Astra 模型作弊率仅为 Claude 的 1/5,评测再夺高分
QuintinPope5 · x · 2026-09-11
Andon Labs 指出,Astra 模型在取得高分的同时,作弊尝试次数约为得分最高的 Anthropic 模型 Claude Fable 5.1 的 1/5(作弊发生的 run 已从报告分数中剔除)。Quintin Pope 转评称这是『Astra 又一次常见的胜利』。这一对比触及当前 eval 领域的敏感话题:模型在高难度评测中『钻空子』的频率差异,可能比原始分数更能说明模型的真实能力与行为特性。
所属事件:评测方称 Astra 作弊率仅为 Claude 五分之一(2 条相关)→
「模型」频道最新
- Hume 语音克隆排行榜:最自然的克隆听感仅排第 8 — realmrfakename · 2026-09-11
- CursorBench 4.0 发布:任务更难更长程,各家模型得分集体下降 — StringChaos · 2026-09-11
- 开发者实测称 Astra 是个好模型 — jxnlco · 2026-09-11
- 新模型跑分「离谱」:效率直逼 Sol/Opus 水平,RL 基建细节曝光 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 技术深读:死磕 KV cache 压缩造就高效前沿模型 — nrehiew_ · 2026-09-11
- 关掉推理模式反而找出 Opus 5 漏掉的问题 — cephaloform · 2026-09-11