GPT-6 Astra 对阵 GPT-5.6 Sol:50 个真实 PR 代码评审基准实测
entelligenceai17 · reddit · 2026-09-10
Entelligence AI 在 50 个真实 PR(Cal.com、Sentry、Discourse、Keycloak、Grafana)上对比两款模型的代码评审能力:Sol 确认 107 个 bug,Astra 91 个,且 Sol 单 bug 成本更低;但 Astra 精确率更高、速度更快,结果经独立验证。团队下周将测试 Fable vs Opus,征求改进意见。
「编程与Agent」频道最新
- niji→GPT Image→MiniMax H3→Codex,打造像素完美动画全流程 — Hailuo_AI · 2026-09-10
- 开发者发布 Traser:自动定位「跑成功但结果错误」的 agent 运行 — Sensitive-Parsnip-12 · 2026-09-10
- 实验:错误前提下三个 AI Agent 互相寻找,仅一个成功且不自知 — turtle_bazon · 2026-09-10
- 钢铁侠粉丝用 GPT-6 Astra 做出战甲拆解 3D 网页,自认前端被超越 — TheMoonMidas · 2026-09-10
- Hermes Agent 路由缺陷致用户多付 100 美元,附规避方法 — WolframRvnwlf · 2026-09-10
- 分析师质疑编码智能体数据:面向终端用户,难反映自主 RSI 任务 — eliebakouch · 2026-09-10