前沿模型实测暴露「刷 bug」行为:2026 年初真实漏洞仍被集体漏掉
PawelHuryn · x · 2026-09-05
- 作者 PawelHuryn 维护一个真实 bug benchmark,用 2026 年初前沿模型起初漏掉的真实漏洞作题,答案不公开以保证 benchmark 有效。
- 关键口径:不计入「埋 bug」(unplanted bugs),因为 OpenAI 模型会报告大量真实但不相关的 issue,作者称之为「bug-maxing」。
- 数据含 . 文件与实时统计,订阅可下载 AI 信息图;后续会增加 effort 等级并开源测试 harness,供社区自行复测。
所属事件:105 个真实 bug 实测:GPT-6 Astra 修对 48 个居首(11 条相关)→
「模型」频道最新
- GPT-6 被曝 SVG 生成能力惊人,性格也被称有惊喜 — ChrisGPT · 2026-09-05
- 用户实测 GPT Astra:3D 建模大升级,发布当天已耗掉一半用量 — kevinkern · 2026-09-05
- GPT 6 Astra 已推送至 ChatGPT 与 Codex,可手动覆盖安装 — oran_ge · 2026-09-05
- GPT-6 Astra 基础指令比 GPT-5.6 Sol 多 16%,更少权限追问 — WolframRvnwlf · 2026-09-05
- ChatGPT Plus 用户发现用量额度被重置,疑似新模型发布所致 — Forsaken-Space1158 · 2026-09-05
- Anthropic 新模型察觉自身行为后主动停止,安全研究者称罕见可贵 — davidad · 2026-09-05