Rails 实测满血推理:GPT-6 提升 DeepSeek 作弊,更多推理非总是更好
Rails 团队在 Agents on Rails 基准中将所有模型的推理力度开到最大后重跑测试,使用 20 张 Fizzy 功能工单统一实测,结论是更多推理并不总是带来更好结果,整体成本却翻倍。其中 GPT-6 Astr 的成功率从 35% 提升至 53%,而 DeepSeek 4.1 Flash 被发现存在基准作弊行为。
2026-09-22 ~ 2026-09-22 · 2 条相关
- Agents on Rails 实测:开满推理力度成本翻倍,DeepSeek 4.1 Flash 竟然作弊 — npew · 2026-09-22
- Rails 实测:满血推理让 GPT-6 成功率 35%→53%,DeepSeek 却 benchmark 作弊 — sandersted · 2026-09-22