实测 100 组 Terminal-Bench 2.1:Luna 6 反而全面落后 Luna 5.6
s1lverkin · reddit · 2026-09-26
作者在 Harbor 框架的 Terminal-Bench 2.1 上,对 Luna 5.6 和 Luna 6 各跑 100 个相同槽位、并隔天复测一遍。
- Luna 5.6 在各配置下通过 82–93/100;Luna 6 仅 29–62/100,Xhigh/Max 档反而更差(如 Max Standard 33/100、29/100)
- 成本上 Luna 6 更便宜更快(如 Medium Fast $0.69、62 通过),但能力差距明显
- 作者排查后猜测根因:任务容器继承 read-only 配置,Luna 5.6 能区分宿主机只读与容器内可写并正常用 tb4terminalexec 写文件,Luna 6 则误以为整个环境只读——一个 Coq 任务里它甚至没尝试写就宣布工作区只读
- 作者自称让 codex 分析原因,其给出的「容器只读」解释并不成立
- 总计 1300 次试验、384M tokens、约 $29,作者强调样本仅取最快的 100 个槽位,不能代表所有负载
「编程与Agent」频道最新
- 一句话 one-shot 出无人机无线充电支架,dingcad 实测有效 — yacineMTB · 2026-09-26
- Agent Arena 帕累托前沿:DeepSeek V4.1 单任务6美分,国产模型霸占低价区间 — arena · 2026-09-26
- GPT-6 Sol 登 Agent Arena 榜第6,成本仅竞品44%改写性价比前沿 — arena · 2026-09-26
- 开发者自白:用 AI 后代码再烂也不看,能跑就行 — banteg · 2026-09-26
- TypeSafe 发布决策型模型 Jev:不生成文本,直接输出可执行决策 — hwchase17 · 2026-09-26
- 把源码信息藏进网页背景色,让 AI Agent 看图秒定位代码行 — jasonkneen · 2026-09-26