50 真实 PR 实测:GPT-6 Astra 抓 92 个 bug,GPT-5.6 Luna 以 3.6% 成本追平 75%

entelligenceai17 · reddit · 2026-09-14

Entelligence 团队在 Cal.com、Sentry、Discourse、Keycloak、Grafana 五个开源项目的 50 个真实 PR 上做了代码审查基准:

结论指向:旗舰模型在召回上有明显优势,但小模型在成本效益上非常能打。

所属事件:GPT-6 Astra 与 GPT-5.6 Luna 代码审查基准实测出炉(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →