同一 agent 循环实测 14 模型:硬性预算下 GPT-6 Astra 全胜
smith2008 · reddit · 2026-10-02
作者为「照片转 Blender 场景」agent 做了统一基准:每个场景限时 20 分钟、$4、60 次请求,14 个模型当大脑,由 agent 外部的确定性代码评审重渲染结果。
关键发现:
- 在 agent 外强制限制、要求尽早保存——预算耗尽即终止,什么都没保存就打 0 分。
- 模型对「完成」的判断不同:GPT-5.6 Sol/Terra 约 8 分钟就宣布完工、预算大半没用;GPT-6 Astra 从不停止,每个场景都烧满 $4,拿下全部三张照片的第一。
- 重度推理会输给时间:DeepSeek V4.1 Flash 和 Qwen3.8 Max 分别把 83% 和 68% 的输出花在推理上,20 分钟内没保存任何东西;放宽到 60-120 分钟能建出部分场景。
- 厂商管道影响结果:Anthropic 需显式缓存标记(否则 0% 缓存,8-18 次请求烧光预算;修复后 96-97%);Google 端点拒绝以模型消息结尾的请求,需网关补一个收尾 user turn;Kimi K3 出现过空首答。
- agent 外评审:重渲染评分、加 35° 第二视角防「平面糊弄」、检查原图没被当贴图。
榜首:GPT-6 Astra 66 分($3.91/次)、GPT-6.1 Sol 61($0.36)、Claude Opus 5.5 60($1.19)、Claude Sonnet 5.5 56($0.50)。
所属事件:14 模型盲测 3D 重建:GPT-6 Astra 三场景全胜(3 条相关)→
「编程与Agent」频道最新
- Mirelo 接入 AWS 的 Kiro IDE,AI Agent 可直接生成音效 — ordax · 2026-10-02
- 每天用 Codex 八小时仍有大量额度,网友晒图惊呼“你们怎么用得完” — honkballs · 2026-10-02
- GitHub 1.8 万星免费 Harness Engineering 课程:14 讲+8 实战项目 — Hesamation · 2026-10-02
- 开源项目 Manifesto:让 UI 与 Agent 走同一套应用内操作规则 — TraditionalListen994 · 2026-10-02
- 安全通告里的 void* 指针:AI 正在翻 Linux 内核旧代码 — mircomusolesi · 2026-10-02
- A2A 协议声量高落地少:多数团队仍停留在评估阶段 — Diarnstinc_Crew_6510 · 2026-10-02