50 真实 PR 实测:GPT-6 Astra 抓 92 个 bug,GPT-5.6 Luna 以 3.6% 成本追平 75%
entelligenceai17 · reddit · 2026-09-14
Entelligence 团队在 Cal.com、Sentry、Discourse、Keycloak、Grafana 五个开源项目的 50 个真实 PR 上做了代码审查基准:
- GPT-6 Astra 确认发现 92 个 bug,GPT-5.6 Luna 为 69 个
- 但 Luna 以仅 3.6% 的成本捕获了 75% 的已确认 bug
- 完整评测拆解包括成本、平均输出 token、延迟、精确率,以及数据/逻辑、安全、并发等 bug 类型
- 团队预告下一期做 Astra vs Fable 5.1 对比,征集评测改进建议
结论:旗舰模型召回率更高,但平价模型在成本效益上极具竞争力。
所属事件:GPT-6 Astra 与 GPT-5.6 Luna 代码审查基准实测出炉(2 条相关)→
「编程与Agent」频道最新
- 开源 Codex skill「Relay」:线程驱动的轻量多智能体编排 — daniel_mac8 · 2026-09-15
- 开源项目 Relay:让 Codex 主任务派发子任务,一条消息回报结果 — daniel_mac8 · 2026-09-15
- Bolt Forge 上线:免费开放 GLM、DeepSeek、Kimi,用量提升最高 50 倍 — HeyAmit_ · 2026-09-15
- 从零手写 Agent Harness:资深研究者的入门指南 — omarsar0 · 2026-09-15
- 从零构建 Agent Harness 入门指南:LLM 模块、工具模块与主循环三件套 — ryunuck · 2026-09-15
- 从 Cursor 转投 Claude Code:第 3 天就用光了额度 — jdluk87 · 2026-09-15