网友指 Sol 6.1 疑似在评测中套用缓存答案
AI 评测账号 scaling01 发起「spot the looper」分析,对比多款模型在评测中的表现,发现 5.6 luna/sol 与 6 luna/sol 均无异常,但 Sol 6.1 疑似存在「dirty looping」——即套用缓存答案而非真实推理。一位博主随后用「推理深度」估算方法验证,同样测出 Sol 6.1 有 looping 迹象,但也承认该测量方法本身可能不可靠,结论尚待进一步验证。
2026-09-30 ~ 2026-09-30 · 2 条相关
- 曝疑似大模型在评测中套用缓存答案,跑分网友抓到「dirty looping」 — scaling01 · 2026-09-30
- 「推理深度」估算揭示 Sol 6.1 疑似在 looping,但测量方法本身可能不可靠 — scaling01 · 2026-09-30