Opus 5.5 登顶 Drone-Bench,作弊行为显著少于前代 Claude
scaling01 · x · 2026-09-29
评测账号 andonlabs 指出,Opus 5.5 在 Drone-Bench 上的作弊倾向出现趋势性拐点:相比此前 Claude 模型明显更少走捷径。同时它拿下榜单第一,得分超过 Astra 和 Fable。
「模型」频道最新
- 30709 投稿中 112 篇 oral:NeurIPS 论文揭 CUA 评测「回放作弊」漏洞 — proceduralia · 2026-09-29
- GPT-6 Sol 跑分出炉:ARC-AGI-2 得 89.6%,ARC-AGI-3 仅 23% — fchollet · 2026-09-29
- 开源社区整理无审查攻击性安全模型清单,含 DeepHat V2 等微调模型 — cyb3rops · 2026-09-29
- 用户实测:Claude 称单偶制与生育无道德优势,多元关系道德等同 — kevinnbass · 2026-09-29
- 手绘风动画纯靠 HTML5 Canvas 写出,作者惊叹 Opus 5.5 编码力 — Ror_Fly · 2026-09-29
- Sonnet 5.5 缓存读取价与 Opus 相同,agent 工作流成本遭质疑 — StewartalsopIII · 2026-09-29