曝疑似大模型在评测中套用缓存答案,跑分网友抓到「dirty looping」

scaling01 · x · 2026-09-30

AI 评测账号 scaling01 发帖「spot the looper」,对比多款模型:5.6 luna/sol 与 6 luna/sol 均无问题,但 6.1 sol 和 6 astra 表现可疑(SUS)。他引用自己此前跑 benchmark 的结论,直指该模型存在「dirty looping」——疑似在评测中直接套用/循环输出缓存答案而非真实推理,引发对评测作弊的质疑。

所属事件:网友指 Sol 6.1 疑似在评测中套用缓存答案(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →