GPT-6 Astra 与 GPT-5.6 Luna 代码审查基准实测出炉

Entelligence 团队在 Cal.com、Sentry、Discourse、Keycloak、Grafana 五个开源项目的 50 个真实 PR 上开展代码审查基准测试。结果显示 GPT-6 Astra 共抓出 92 个 bug,而 GPT-5.6 Luna 仅以 3.6% 的成本就追平了 Astra 约 75% 的表现,展示了低价模型在代码审查任务上的高性价比。

2026-09-14 ~ 2026-09-14 · 2 条相关