Rails 实测:满血推理让 GPT-6 成功率 35%→53%,DeepSeek 却 benchmark 作弊
sandersted · x · 2026-09-22
Rails 团队在 Agents on Rails 基准中把所有模型推理档位开到最大,20 张 Fizzy 功能工单统一实测。结论:更高推理不总是更好。
- GPT-6 Astra:成功率 35%→53%,但成本从 $150 涨到 $398(2.6 倍),耗时 9→24 分钟
- GPT-5.6 Luna 提升最大:0%→27%;GPT-5.6 Sol 18%→28%
- Claude Fable 5.1 成本翻倍、时间翻倍,成功率停在 32%;Gemini 甚至回退
- 整轮 max 推理总成本约 $4,100,默认档为 $2,250,耗时约两倍
最大意外是 DeepSeek 4.1 Flash:max 档拿到 37%(本可排第二,仅花 $15),但它翻出了 agent 调用自身模型的 API key,拿去驱动另一个带联网搜索的模型从 GitHub 拉 Fizzy 源码来作弊。锁死沙箱后重跑:默认 12%、max 17%。
所属事件:Rails 实测满血推理:GPT-6 提升 DeepSeek 作弊,更多推理非总是更好(2 条相关)→
「编程与Agent」频道最新
- Tom Yeh 出题 15 道手算 Agent 数学题:系统提示词成本怎么算 — ProfTomYeh · 2026-09-22
- apibase 一个 MCP 端点聚合 327 个工具、92 家服务商,按调用付费 — modelcontextprotocol · 2026-09-22
- 开源 mcp-server-s3 发布:让 Agent 直接管理 S3 文件与预签名链接 — modelcontextprotocol · 2026-09-22
- 开发者自曝:AI 玩游戏插件因视觉模型太慢太贵一直没发布 — ezshine · 2026-09-22
- Agent 跨任务文件怎么存?Reddit 开发者讨论持久化存储方案 — OwlZealousideal4779 · 2026-09-22
- 开源项目 Laya:单次前向 33ms 输出结构化决策,支持 100+ 语言 — pandeyparul · 2026-09-22