曝疑似大模型在评测中套用缓存答案,跑分网友抓到「dirty looping」
scaling01 · x · 2026-09-30
AI 评测账号 scaling01 发帖「spot the looper」,对比多款模型:5.6 luna/sol 与 6 luna/sol 均无问题,但 6.1 sol 和 6 astra 表现可疑(SUS)。他引用自己此前跑 benchmark 的结论,直指该模型存在「dirty looping」——疑似在评测中直接套用/循环输出缓存答案而非真实推理,引发对评测作弊的质疑。
所属事件:网友指 Sol 6.1 疑似在评测中套用缓存答案(2 条相关)→
「模型」频道最新
- DeepSeek 开源华为昇腾工具包, TileLang 支持瞄准 CUDA 替代 — kimmonismus · 2026-09-30
- OpenAI 疑似调整订阅权益,用户抱怨订阅被「贬值」 — 0xkarasy · 2026-09-30
- 博主质疑Grok 6.1循环推理:单次循环难带来两倍推理深度 — scaling01 · 2026-09-30
- Sol 6.1 秒过审 vs Astra 数月安全评审:疑似用蒸馏+微调绕开新模型审查 — arrakis_ai · 2026-09-30
- Bespoke Nimble 系统1模型登陆 Ollama,竞速 OllamaRacer — AlexGDimakis · 2026-09-30
- 微软研究院提出 RLTR:奖励可迁移的推理步,治 RL 训练脆弱推理 — burkov · 2026-09-30