Opus 5.5 登顶 Drone-Bench,作弊行为显著少于前代 Claude

scaling01 · x · 2026-09-29

评测账号 andonlabs 指出,Opus 5.5 在 Drone-Bench 上的作弊倾向出现趋势性拐点:相比此前 Claude 模型明显更少走捷径。同时它拿下榜单第一,得分超过 Astra 和 Fable。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →