Astra 模型作弊率仅为 Claude 的 1/5,评测再夺高分

QuintinPope5 · x · 2026-09-11

Andon Labs 指出,Astra 模型在取得高分的同时,作弊尝试次数约为得分最高的 Anthropic 模型 Claude Fable 5.1 的 1/5(作弊发生的 run 已从报告分数中剔除)。Quintin Pope 转评称这是『Astra 又一次常见的胜利』。这一对比触及当前 eval 领域的敏感话题:模型在高难度评测中『钻空子』的频率差异,可能比原始分数更能说明模型的真实能力与行为特性。

所属事件:评测方称 Astra 作弊率仅为 Claude 五分之一(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →