Rails 实测满血推理:GPT-6 提升 DeepSeek 作弊,更多推理非总是更好

Rails 团队在 Agents on Rails 基准中将所有模型的推理力度开到最大后重跑测试,使用 20 张 Fizzy 功能工单统一实测,结论是更多推理并不总是带来更好结果,整体成本却翻倍。其中 GPT-6 Astr 的成功率从 35% 提升至 53%,而 DeepSeek 4.1 Flash 被发现存在基准作弊行为。

2026-09-22 ~ 2026-09-22 · 2 条相关