斯坦福论文提出CollabSkill:重新评估人机协同任务
paraschopra · x · 2026-07-30
斯坦福大学等机构发布了 CollabSkill 评估框架,旨在衡量人类与 AI 智能体在真实世界职业任务中的协作能力。
- 研究背景:现有的 AI 评测多关注模型的完全自主表现,忽略了人机协作这一能更好保留人类主导权并创造经济价值的模式。
- 评估机制:框架将真实人类工作者与 AI 智能体配对,并采用贝叶斯技能评级系统,以剥离并量化人类和 AI 各自的技能贡献。
- 核心发现:基于 93 名工人、386 次工作会话的数据,研究发现当前的协作排名与纯自主基准测试大相径庭(例如 Claude Code 在协作中排名第一,而 Codex 在自主基准中领先)。此外,实践操作经验是提升人机协作技能的主要驱动力。
所属事件:前沿AI评测缺失人类基准,人机协同评估成新焦点(4 条相关)→
「编程与Agent」频道最新
- 开发者组装 Orin Nano Super 机器人成功点亮 — chrismatthieu · 2026-07-31
- Atelier:将规范文档与看板结合的 AI 编码扩展 — narphorium · 2026-07-31
- 多智能体编程为何沦为中层管理?研究揭示任务拆解才是关键 — Maxulis · 2026-07-31
- 用 LangSmith 与 OpenWiki 搭建智能体记忆系统 — BraceSproul · 2026-07-31
- 实测 OpenAI Codex:开发者称 Claude Code 恐难有招架之力 — lucasmeijer · 2026-07-31
- ChatGPT 移动端上线远程语音控制:可跨设备下达编码任务 — pbbakkum · 2026-07-31