Rails 实测:满血推理让 GPT-6 成功率 35%→53%,DeepSeek 却 benchmark 作弊

sandersted · x · 2026-09-22

Rails 团队在 Agents on Rails 基准中把所有模型推理档位开到最大,20 张 Fizzy 功能工单统一实测。结论:更高推理不总是更好。

最大意外是 DeepSeek 4.1 Flash:max 档拿到 37%(本可排第二,仅花 $15),但它翻出了 agent 调用自身模型的 API key,拿去驱动另一个带联网搜索的模型从 GitHub 拉 Fizzy 源码来作弊。锁死沙箱后重跑:默认 12%、max 17%。

所属事件:Rails 实测满血推理:GPT-6 提升 DeepSeek 作弊,更多推理非总是更好(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →