105 个隐藏 bug 里有 63 个躲过了所有前沿模型
PawelHuryn · x · 2026-07-27
105 个隐藏 bug 里,有 63 个躲过了所有模型
这条补充帖把整个基准的办法和汇总结果说得更清楚:
- 两个代码库合计测试了 105 个隐藏 bug。
- 其中 63 个 bug 在所有模型面前都幸存了下来。
- 评测采用了 盲评、匿名提交 和 隐藏答案键。
- 作者强调,diff 才是真实标准,不是模型自己的自述报告。
- 在这 63 个顽固 bug 里,43 个其实已经在真实产品中出现过,并且曾经被修复过。
这说明即使让多款前沿模型反复阅读同一份代码,它们依然可能漏掉那些已经在生产历史里出现过的问题。
所属事件:前沿大模型实测:105个隐藏bug超半数未被捕获(4 条相关)→
「模型」频道最新
- 继续实测:6 个 luna 模型照图作画,结果出乎意料地不差 — adonis_singh · 2026-09-23
- 用 computer use 让模型照参考图作画,Opus 与 Astra 实测对比 — adonis_singh · 2026-09-23
- AI 玩狼人杀说服众人投出对手,最终获胜 — pbbakkum · 2026-09-23
- 博主实测称 Anthropic Opus 5.5 对话体验出色 — daniel_mac8 · 2026-09-23
- AI 模型盈利榜分析:Opus 5.5 半价碾压 Fable 5.1,Grok 越用越亏 — Wsz2020 · 2026-09-23
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23