限定
何时人类与 AI 的组合真正有用:系统综述与元分析 ↗
综合 106 项实验后,人机组合平均低于表现更好的单独主体,且任务类型解释了重要差异。
- 来源范围
- 已审阅摘要
- 证据强度(关系评估)
- 0.95
- AI 判断置信度
- 0.95
- 人工复核
- 尚无人类复核
- 溯源
- codex-research-curation:public-evidence-v1 · codex-research-curation · initial-curation-v1
研究问题 · 不是已确立结论
比较任务类型、互补错误与依赖设计,而不只看平均提升。
公开数据库资料 · 页面可能被缓存;不代表实时监控或人工验证。
部署 AI 并不能自动说明联合表现优于各自单独工作。我们关心的是:在同一任务和评价标准下,组合是否超过两者中较好的一个,而不只是相对人类基线提高。
概念与范围:互补表现、错误相关性、适当依赖、任务类型。当前资料涉及实验与分类任务,不直接代表所有组织中的长期协作。
以下关系来自现有获准公开的论断档案,不根据标题相似性推断支持关系。摘要与关系文字是 HIE 的资料解读,非作者原文。
限定
综合 106 项实验后,人机组合平均低于表现更好的单独主体,且任务类型解释了重要差异。
支持
随机提供 ChatGPT 使用权后,参与者在边界明确的职业写作任务中速度与质量均提高,技能较低者获益更大。
支持
AI 辅助在特定客服场景中提高了生产力,但不同经验水平员工的收益并不相同。
限定
解释提高了人们接受 AI 建议的概率,却没有进一步提升互补团队表现。
HIE 编辑性解释 · 非新实证发现
现有资料提供不同层次的解释:任务类型可能改变组合收益;互补的预测错误可能有助于组合;提供解释本身不保证适当依赖。这些不是互相替代的普遍定律。
仍待验证:效应能否跨人群、跨模型与长期持续?什么分工能减少共同错误?哪些结果只是评价标准变化?
核对入口:作者机构发布页与原始论文。仅核对这些页面不意味着已完成人工科学复核。
待验证假设 / Proposed
设想:明确分工与校准依赖能改善部分任务的组合表现。拟比较人类、AI、自由协作与有边界委托四种条件,固定任务、评分、模型与样本;记录错误与成本。尚未招募或执行。
支持条件:组合超过较优单独基线且可独立复现。推翻或限定条件:没有改善、收益仅来自更多资源,或风险与成本抵消提升。预注册与授权应先于执行。
札记与实验:暂无已执行结果。可建议反证、复现设计或获授权资源,不视为参与者已加入。
参与方式与贡献边界 →