50 个真实 PR 实测 GPT-6 Astra vs GPT-5.6 Sol:107 比 91 个确认 bug
entelligenceai17 · reddit · 2026-09-10
社区团队用来自 Cal、Sentry、Discourse、Keycloak、Grafana 的 50 个真实 PR 对 GPT-6 Astra 与 GPT-5.6 Sol 做了代码基准测试。结果:Sol 找到 107 个确认 bug,多于 Astra 的 91 个;但 Astra 精确率更高、延迟更低。所有发现均经独立验证。团队下周还将测试 Fable vs Opus,现公开征集对评测方法的反馈。
所属事件:真实 PR 实测:GPT-6 找出 107 个 bug 胜 GPT-5.6(3 条相关)→
「编程与Agent」频道最新
- LLM 护栏的正确心智模型:独立于模型的输入输出检查层 — Careless_Sabfey_4906 · 2026-09-10
- Ethan Mollick:用 Codex 这类 agent,关键是学会「驾驶」它 — emollick · 2026-09-10
- AgentGrad:干预引导的 prompt 优化,提速 2.5 倍达 SOTA — _akhaliq · 2026-09-10
- Claude 内嵌 cyber 控件 vs Codex 独立编排模型,哪种架构更优? — HankYeomans · 2026-09-10
- Claude-Red 开源:用 SKILL.md 把 Claude 武装成红队专家 — tom_doerr · 2026-09-10
- 何时该把思考外包给 AI?一个「工具性 vs 构成性」判断框架 — arpitingle · 2026-09-10