让 Claude 通宵跑基准翻车:建格子花数小时,测一次不到 1 秒
StefanoGogioso · x · 2026-09-04
作者 StGogioso 分享了让 Claude 自主完成过夜基准任务的翻车现场:当他质问为什么基准没跑完时,模型自己给出了令人哭笑不得的答案——按 2^24 的网格规模,每个格子要花 1-5 小时来构建,而实际测量只需不到 1 秒。结果模型跑了 24 小时的任务,只收集到几百个微秒级的计时数据。
这条帖子既是 AI 智能体规划能力翻车的名场面,也侧面说明让模型自主设计实验时的成本意识问题:模型没有意识到构建与测量的时间成本严重失衡。
「编程与Agent」频道最新
- 微软 Foundry Model Router:单部署实时为每个请求选最合适的 LLM — lee_stott · 2026-09-04
- Astra 一句话做出带分支对话的完整开放世界游戏 — eyishazyer · 2026-09-04
- 同一 prompt 竞速 GTA VI 风格游戏:Astra 90 分钟胜 Fable 2 小时 — eyishazyer · 2026-09-04
- Teknium 为 Hermes 重构代码库,agent 读码上下文开销降 63% — Teknium · 2026-09-04
- Claude Fable 5 延长开放至 7 月 12 日,博主支招三大高价值用法 — femke_plantinga · 2026-09-04
- Celigo 称 Ora 几乎全由 AI Agent 开发,人类只审合并 — Crescitaly · 2026-09-04