斯坦福 CollabSkill 评测人机协作:Claude Code 登顶超越 Codex
stanfordnlp · x · 2026-10-06
斯坦福 NLP 组将在 COLM 会议首个口头报告环节展示 CollabSkill——一个评测真实职业任务中人机协作的框架:
- 设计:将真实人类工作者与 AI agent 配对,任务是匹配其职业背景的经济价值任务;用贝叶斯技能评级系统把人类与 agent 的贡献分离量化
- 数据规模:93 名工作者贡献 386 个工作会话、超 1500 条 prompt
- 关键发现(agent 侧):排名与现有全自主 benchmark(Codex 领先)明显分歧——Claude Code 排名第一
- 关键发现(人类侧):实践经验是协作技能的主要驱动因素,实际协作能显著提升工作者的 AI 素养
该工作旨在推动社区系统化评测人机协作,而非只看全自主能力。
所属事件:斯坦福发布CollabSkill人机协作评测,Claude Code居首(2 条相关)→
「编程与Agent」频道最新
- ASCENT:智能体部署中自蒸馏验证经验,权重持续进化无需再训练 — Haodong Lu · 2026-10-06
- PluginRSI 把 agent harness 拆成可复用插件递归进化,跨任务加速优化 — Yaorui Shi · 2026-10-06
- 开源课程 AI Engineering from Scratch:从裸数学手写每个算法,四种语言实现 — ghumare64 · 2026-10-06
- 一条提示词四条管线:Opus 5.5 实测 Blender/Kimodo/Cascadeur 做人形动画 — chongdashu · 2026-10-06
- Cal.com 登陆 Grok Build 插件市场:OAuth 免 API Key 管日程 — tetsuoai · 2026-10-06
- 边走边留注释,AI 实时帮你搭建游戏世界 — TAbrodi · 2026-10-06