专题 · FULL STORY
Anthropic 开放真实 Claude 使用数据
Anthropic 宣布首次向外部研究者开放脱敏的真实 Claude 对话数据,随后基于约 40 万次 Claude Code 会话发布实证研究,揭示人类与 AI 分工协作的真相:懂业务的用户从 AI 获益更多。
2026-08-27 ~ 2026-08-28 · 2 集 · 15 条
第 1 集 · Anthropic 首次开放真实 Claude 数据,25 万对话揭示人机协作真相(2026-08-27,13 条)
Anthropic 宣布首次向外部研究人员和机构开放经隐私保护的真实 Claude 使用数据,通过 Anthropic Insights(前称 Clio)以聚合遥测数据形式提供。Jack Clark 表示,AI 系统极为复杂,仅靠实验室内部评估是傲慢且错误的,必须将系统属性及平台交互数据外部化。试点期间已有三组外部研究机构利用这些数据完成独立分析,这是此类此前仅限 AI 实验室内部的研究首次外部化,为独立评估 AI 的真实社会影响提供了新范式。
已确认
- 数据开放形式:Anthropic Insights(前称 Clio)提供聚合、脱敏、隐私保护的遥测使用数据,首批试点面向外部研究员与机构,用于研究 AI 的实际影响。
- 试点成果:三组外部研究机构基于该数据完成独立分析;其中斯坦福 Diyi Yang 团队开展名为 "Human–AI Collaboration at Scale" 的大规模人机协作研究。
- 研究规模:基于 249,834 次真实 Claude 对话。
- 任务关键性发现:与"用户只把低责任任务交给 AI"的旧观点相反,用户在法律、金融等关键、难以逆转的领域高频委托任务;且风险越高,用户适应或批评 AI 输出的意愿反而降低,更多转向试图理解输出。
- 协作模式:AI 主要作为增强而非全自动工具;人类主导的协作占 72%,任务越重要人类参与越深;67% 的对话中 AI 表现出教学行为,这类互动建立在理解之上。
- 摩擦现象:49.7% 的对话包含某种形式的摩擦;部分摩擦具有生产力,能带来澄清或学习;用户在 78.7% 的摩擦对话中会主动尝试恢复。最有效的恢复策略包括质疑模型推理、要求简化输出、纠正事实错误,而单纯道歉等策略效果较差。
为什么重要
- Diyi Yang 团队总结称,尽管研究最初关注任务关键性、代理权和摩擦力等假设,最终结论都指向"人"这一因素:仅提升 AI 能力不足以实现强人机协同。
- 数据外部化打破了 AI 实验室对使用数据的垄断,让外部团队能够独立研究 AI 的实际影响,为评估 AI 的真实社会影响提供了新范式。
- Anthropic 首次开放外部研究真实 Claude 数据 — AnthropicAI · 2026-08-27
- Anthropic 开放外部研究员访问脱敏 Claude 数据 — Diyi_Yang · 2026-08-27
- 研究:高风险任务中用户更少纠正 AI 输出 — EchoShao8899 · 2026-08-27
- Anthropic 开放真实数据用于人机协作研究 — Diyi_Yang · 2026-08-27
- 研究显示用户将高风险任务委托给 AI 的比例惊人 — EchoShao8899 · 2026-08-27
- 49.7% 对话存在摩擦,人机协作并非自然发生 — EchoShao8899 · 2026-08-27
- Anthropic 研究:25 万次对话揭示人机协作中的任务关键性与摩擦 — EchoShao8899 · 2026-08-27
- Anthropic 开放 Insights 数据支持独立研究 — EchoShao8899 · 2026-08-27
- Anthropic 首次开放外部渠道供研究者访问 Claude 数据 — mattbeane · 2026-08-27
- 基于 25 万次对话研究:人类如何与 AI 协作 — Diyi_Yang · 2026-08-27
- Anthropic 研究:人机协作中 72% 对话由人主导 — Diyi_Yang · 2026-08-27
- 斯坦福研究:24.9 万次对话揭示人机协作真实模式 — EchoShao8899 · 2026-08-27
- Anthropic 首次开放 Claude 真实流量数据供研究 — Diyi_Yang · 2026-08-27
第 2 集 · Anthropic 研究 40 万次 Claude 会话:懂业务者用 AI 效果更佳(2026-08-28,2 条)
Anthropic 发布基于约 40 万次 Claude Code 会话、覆盖约 23.5 万用户、跨度 7 个月的实证研究。发现人类与 AI 呈分工模式:人类承担约 70% 的规划决策(做什么),AI 承担约 80% 的执行决策(怎么做)。研究还显示,具备领域知识的专家使用 Claude Code 的成功率明显更高,说明懂业务比单纯懂代码更能发挥 AI 编程助手的效用。
- 研究 40 万次 Claude 会话:懂业务的比懂代码的用得更好 — alex_verem · 2026-08-28
- Anthropic 研究揭示:领域专家用 Claude Code 成功率更高 — alex_verem · 2026-08-28