开放性修 bug 任务对比:Astra 平均 222 轮,Sonnet 5.5 需 1330 轮
PawelHuryn · x · 2026-09-29
Pawel Huryn 对比两个模型在开放性问题(如"找出并修复所有 bug")上的表现:开放型任务需要更多轮次。数据显示 Astra(max)平均 222 轮完成,而 Sonnet 5.5(max)平均需要 1330 轮,差距约 6 倍,反映两者在自主探索与修复策略上的显著差异。
「编程与Agent」频道最新
- 阶跃联创朱亦波提出 KITE:把 PD 分离思路引入训练,扩展 Agentic LLM — teortaxesTex · 2026-09-29
- LangChain 团队分享 Agent 开发实践,不用 LangChain 也值得看 — js_craft_hq · 2026-09-29
- CS 学生复盘实习:让 agent 真动手后,我手写了一堆脆弱的防护检查 — Professional-Mine681 · 2026-09-29
- WebBrain:开源本地浏览器 Agent,配 450M 浏览器专用小视觉模型 — ButtercupLyn100 · 2026-09-29
- 第三方实测 NVIDIA OpenShell:默认策略 0/10 泄密,但自动批准 12/12 漏数据 — No-Peanut-6988 · 2026-09-29
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29