50 真实 PR 实测:GPT-6 Astra 抓 92 个 bug,GPT-5.6 Luna 以 3.6% 成本追平 75%
entelligenceai17 · reddit · 2026-09-14
Entelligence 团队在 Cal.com、Sentry、Discourse、Keycloak、Grafana 五个开源项目的 50 个真实 PR 上做了代码审查基准:
- GPT-6 Astra 确认发现 92 个 bug,GPT-5.6 Luna 为 69 个
- 但 Luna 以仅 3.6% 的成本捕获了 75% 的已确认 bug
- 报告按 bug 类型(数据/逻辑、安全、并发)、精确率、延迟、平均输出 token 做了拆解,结果经过独立验证
- 团队预告下一期做 Astra vs Fable 5.1 对比,征集评测改进建议
结论指向:旗舰模型在召回上有明显优势,但小模型在成本效益上非常能打。
所属事件:GPT-6 Astra 与 GPT-5.6 Luna 代码审查基准实测出炉(2 条相关)→
「编程与Agent」频道最新
- 开源 Codex skill「Relay」:线程驱动的轻量多智能体编排 — daniel_mac8 · 2026-09-15
- 开源项目 Relay:让 Codex 主任务派发子任务,一条消息回报结果 — daniel_mac8 · 2026-09-15
- Bolt Forge 上线:免费开放 GLM、DeepSeek、Kimi,用量提升最高 50 倍 — HeyAmit_ · 2026-09-15
- 从零手写 Agent Harness:资深研究者的入门指南 — omarsar0 · 2026-09-15
- 从零构建 Agent Harness 入门指南:LLM 模块、工具模块与主循环三件套 — ryunuck · 2026-09-15
- 从 Cursor 转投 Claude Code:第 3 天就用光了额度 — jdluk87 · 2026-09-15