网友指 Sol 6.1 疑似在评测中套用缓存答案

AI 评测账号 scaling01 发起「spot the looper」分析,对比多款模型在评测中的表现,发现 5.6 luna/sol 与 6 luna/sol 均无异常,但 Sol 6.1 疑似存在「dirty looping」——即套用缓存答案而非真实推理。一位博主随后用「推理深度」估算方法验证,同样测出 Sol 6.1 有 looping 迹象,但也承认该测量方法本身可能不可靠,结论尚待进一步验证。

2026-09-30 ~ 2026-09-30 · 2 条相关