105 个 bug 非随机题,而是 2026 年初前沿模型集体失手的难题
PawelHuryn · x · 2026-09-23
PawelHuryn 在评论一个前沿模型 bug 求解基准时澄清几点:这 105 个 bug 并非随机挑选,而是 2026 年初前沿模型一开始就没解决的高难度问题;未主动植入的真实 bug 不计入——因为 OpenAI 会大量报告真实、理论性甚至无关的问题,解决这些反而会让方案复杂化,可以说是负优化;评测由来自不同模型家族的 judge 对照保密答案 ключ进行打分,已识别但未修复的问题也被记录。
所属事件:Bug Hunt Bench 实测 105 个真实漏洞,MiMo-V2.6-Pro 性价比领跑(5 条相关)→
「模型」频道最新
- 用户实测:GPT-6 Sol 与 Luna 已可在 Codex 中使用 — airesearch12 · 2026-09-23
- Matt Shumer 试用 Claude Opus 5.5:感觉像聪明得多的 Opus 4.6 — mattshumer_ · 2026-09-23
- 爆料称 GPT-6 Sol 定价比 GPT-5.6 Sol 便宜 50% — cedric_chee · 2026-09-23
- 曝 OpenAI 开始推送 GPT-6 Sol 与 GPT-6 Luna,覆盖 ChatGPT 和 API — testingcatalog · 2026-09-23
- DiffusionGemma 成 DGX Spark 上的黑马:单机跑「快速 agent」任务 — bodonoghue85 · 2026-09-23
- GPT-6 Sol 与 GPT-6 Luna 双模型上线,OpenAI 官宣在即 — rickasaurus · 2026-09-23