Sonnet 5.5 最强但最贵,跑 7 倍轮次才赢 GPT-6 Astra

PawelHuryn · x · 2026-10-08

Pawel Huryn 编程基准补充帖:附上全部 effort 等级的分数-时间、分数-成本、分数-轮次曲线。Sonnet 5.5(max) 依然登顶,但靠的是比 GPT-6 Astra 多跑约 7 倍的轮次,是作者测过最有毅力的模型,同时也是榜单上最贵、最慢的,作者判断这是 Anthropic 的校准失误,导致它实际使用价值受限。

所属事件:Paweł Huryn 自建 Bug Hunt 基准实测多款新编程模型(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →