斯坦福 CollabSkill 评测人机协作,Claude Code 登顶
斯坦福 NLP 组在 COLM 会议首个口头报告环节展示 CollabSkill 框架,用于评测真实职业任务中的人机协作能力,让真实人类工作者与 AI 智能体协作完成工作并衡量智能体的能力与贡献。该论文获评审分 8/7/9/8 并入选口头报告。结果显示 Claude Code 登顶,超越 Codex。此外 Stanford NLP 团队还有 Chelsea Finn、Diyi Yang 等多篇论文入选 COLM 口头报告。
2026-10-06 ~ 2026-10-06 · 3 条相关
- 斯坦福 CollabSkill 评测人机协作:Claude Code 登顶超越 Codex — stanfordnlp · 2026-10-06
- COLM 口头报告 CollabSkill:评估人机协作中的智能体贡献 — Diyi_Yang · 2026-10-06
- Stanford NLP 多篇论文入选 COLM 口头报告,含人机协作评测 — stanfordnlp · 2026-10-06