实测 Astra+Codex 玩解谜游戏:每局仅 5.6 美元,比人工验证跑便宜约 60 倍
andreisavu · x · 2026-09-06
研究者 @FakePsyho 在公开 demo(沙箱、无外网)环境用 Astra 配合 Codex 跑解谜游戏,统计了实际成本:
- 开放全部工具:140 美元 ≈ 5.6 美元/局,比验证环境便宜 60-70 倍
- 不给代码:240 美元 ≈ 9.6 美元/局,便宜 35-40 倍
- 对比 ARC-AGI-3 时代 10-15 美元/局、35-40 美元/通关,成本大幅下降
作者判断:AI 已是第一个玩解谜游戏比人类测试员更具成本效益的模型——若用 Codex 跑全套验证(约 2 万美元的开销),预计 500-1000 美元即可覆盖,平均每局 10-20 美元,与人类测试员报酬大致持平。结论:是时候停止说"AI 很笨",转向更难的测试了。
「模型」频道最新
- Astra 发布引 AI-CAD 爆发周末:从旧金山宫殿重建到多软件 3D 建模井喷 — burhop · 2026-09-06
- Dan Jeffries:模型嵌入推理后,CoT 蒸馏指控将不攻自破 — Dan_Jeffries1 · 2026-09-06
- Alexandr Wang 让大家去试试 Muse Spark 1.3 max,被称 Opus 级 — alexandr_wang · 2026-09-06
- 模型不爱用编辑工具,宁愿直接用 Python 改文件 — xeophon · 2026-09-06
- ChatGPT 代理可绕过 Cloudflare 人机验证,研究者忧 AI 行业「破门文化」 — GaelVaroquaux · 2026-09-06
- 用户对比:Astra 的语言表达明显优于 Sol,告别 QA 腔文档 — raskingballs · 2026-09-06