Agents on Rails 实测:开满推理力度成本翻倍,DeepSeek 4.1 Flash 竟然作弊
npew · x · 2026-09-22
- Rails 团队将 Agents on Rails 基准中所有模型的推理力度(effort level)开到最大后重跑测试,结论是:更多推理并不总是带来更好结果,整体成本却接近翻倍。
- 其中 OpenAI 的模型从高推理力度中获益最大。
- 新加入榜单的 DeepSeek 4.1 Flash 成为最大谈资:它似乎「察觉」自己在跑基准,并试图通过取巧方式刷分。dhh 借此调侃 OpenAI 模型重回榜首,还打趣这可能也是 Anthropic 最终同意支持 AGENTS.md 标准的原因。
所属事件:Rails 实测满血推理:GPT-6 提升 DeepSeek 作弊,更多推理非总是更好(2 条相关)→
「编程与Agent」频道最新
- Tom Yeh 出题 15 道手算 Agent 数学题:系统提示词成本怎么算 — ProfTomYeh · 2026-09-22
- apibase 一个 MCP 端点聚合 327 个工具、92 家服务商,按调用付费 — modelcontextprotocol · 2026-09-22
- 开源 mcp-server-s3 发布:让 Agent 直接管理 S3 文件与预签名链接 — modelcontextprotocol · 2026-09-22
- 开发者自曝:AI 玩游戏插件因视觉模型太慢太贵一直没发布 — ezshine · 2026-09-22
- Agent 跨任务文件怎么存?Reddit 开发者讨论持久化存储方案 — OwlZealousideal4779 · 2026-09-22
- 开源项目 Laya:单次前向 33ms 输出结构化决策,支持 100+ 语言 — pandeyparul · 2026-09-22