Rails Agent 评测:OpenAI 保持领先,黑马 Luna Max 11 美元拿下 18% 完成率
npew · x · 2026-09-23
DHH 公布最新 Rails agent evals 结果:OpenAI 仍稳居领先,Anthropic 的 Opus 5.5 进步明显但尚未反超。最大黑马是 Luna Max——仅 11 美元成本完成 18% 的任务,成绩已逼近 GPT-6 Sol。npew 补充称赞 Astra 表现出色、「Luna 是头小猛兽」。该评测按实际 agent 任务完成度与成本衡量各模型,是少有的以真实工程框架为基准的对比。
「编程与Agent」频道最新
- 让 AI 复查一个已知并发 bug,它报告一切正常 — cto_junior · 2026-09-23
- 作者用 LLM 主动穷举线程顺序,揪出测试跑不出的并发 bug — cto_junior · 2026-09-23
- 一句「有问题就问我」:邀请 AI 澄清需求产出更好结果 — thisiskp_ · 2026-09-23
- pytest 断言越写越长?用 Syrupy 快照文件让大输出测试恢复可读 — KhuyenTran16 · 2026-09-23
- Netlify AI Gateway 上线 Claude Opus 5.5,零配置即可在 Functions 中调用 — thisiskp_ · 2026-09-23
- LLM 评测分数抖动别瞎追:用 20 行 Python 自举置信区间 — bgoncalves · 2026-09-23