2 万条编码 agent 轨迹分析:69% 差评指向代码跑不通
arena · x · 2026-09-21
Agent Arena 分析了 Code 赛道 29 个模型、20,840 条用户交互轨迹,用用户的正负反馈来追踪编码 agent 的能力前沿。
主要发现:
- 越新的前沿模型收到的正面反馈明显更多,各实验室的新模型整体反馈净值更正向。
- 抱怨的首要来源仍是「代码跑不通」,占 69.1%;其次是行为敷衍/粗糙。其余主题包括输出不完整(27.1%)、收尾与可用性差(27.1%)、无视指令(20.3%)。
- 各模型有共同短板,但「翻车方式」不同:Fable 5.1 收到的「敷衍/设计差」抱怨少于 Astra(3.9% vs 5.7%),「不稳定」抱怨也更少(3.1% vs 5.0%)。
该思路受 Claude Code 团队统计用户消息中脏话以衡量产品体验的启发,作者为 Dawid Galarowicz。
「编程与Agent」频道最新
- 用 Codex 造客厅墙投游戏,手势隔空操控超炫 — tristanbob · 2026-09-22
- 独立 MCP 服务器质量排行上线,按等级透明评分 — Prestigious-Web-2968 · 2026-09-22
- GitHub Copilot 桌面版将支持直接编辑 Agent 生成 diffs — mariorod1 · 2026-09-22
- 开发者用 JEV 打造 AI 场景导演,一句话改写 Three.js 草地环境 — jamestagg · 2026-09-22
- Agent 总提已解决任务?区分知识与工作记忆的修复法 — Lopsided_Manner_7602 · 2026-09-22
- ProgramAsWeights 开源示例:Qwen3 0.6B 把英文描述编译成神经程序 — yuntiandeng · 2026-09-22