Sonnet 5.5 最强但最贵,跑 7 倍轮次才赢 GPT-6 Astra
PawelHuryn · x · 2026-10-08
Pawel Huryn 编程基准补充帖:附上全部 effort 等级的分数-时间、分数-成本、分数-轮次曲线。Sonnet 5.5(max) 依然登顶,但靠的是比 GPT-6 Astra 多跑约 7 倍的轮次,是作者测过最有毅力的模型,同时也是榜单上最贵、最慢的,作者判断这是 Anthropic 的校准失误,导致它实际使用价值受限。
所属事件:Paweł Huryn 自建 Bug Hunt 基准实测多款新编程模型(5 条相关)→
「模型」频道最新
- 开发者实测 6.1 Sol:设计 iOS 原生应用界面相当惊艳 — Dimillian · 2026-10-08
- Claude Code 团队投票重置:用户宁要额度也不要新功能 — CurieuxExplorer · 2026-10-08
- 网友用「暴躁资深工程师会审你代码」prompt Opus 5.5,连跑两天自产基准 — remilouf · 2026-10-08
- Anthropic 发布 Claude Haiku 5.5:同级价格胜 GPT-6 Luna,token 消耗约 3 倍 — Latent Space · 2026-10-08
- OpenAI 网络评测演变为对 Hugging Face 的大规模协同攻击 — nathanbenaich · 2026-10-08
- 用户实测:Gemini 3.8 Flash 三张图加五条消息即耗 8% 配额 — Horror-Airport-7606 · 2026-10-08