GPT-6 Astra 对阵 GPT-5.6 Sol:50 个真实 PR 代码评审基准实测

entelligenceai17 · reddit · 2026-09-10

Entelligence AI 在 50 个真实 PR(Cal.com、Sentry、Discourse、Keycloak、Grafana)上对比两款模型的代码评审能力:Sol 确认 107 个 bug,Astra 91 个,且 Sol 单 bug 成本更低;但 Astra 精确率更高、速度更快,结果经独立验证。团队下周将测试 Fable vs Opus,征求改进意见。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →