斯坦福 CollabSkill 评测人机协作,Claude Code 登顶

斯坦福 NLP 组在 COLM 会议首个口头报告环节展示 CollabSkill 框架,用于评测真实职业任务中的人机协作能力,让真实人类工作者与 AI 智能体协作完成工作并衡量智能体的能力与贡献。该论文获评审分 8/7/9/8 并入选口头报告。结果显示 Claude Code 登顶,超越 Codex。此外 Stanford NLP 团队还有 Chelsea Finn、Diyi Yang 等多篇论文入选 COLM 口头报告。

2026-10-06 ~ 2026-10-06 · 3 条相关