「推理深度」估算揭示 Sol 6.1 疑似在 looping,但测量方法本身可能不可靠

scaling01 · x · 2026-09-30

博主用一项「真实推理深度」估算做了「spot the looper」分析:5.6 luna/sol 和 6 luna/sol 都测不出 looping 迹象,而 6.1 sol 和 6 astra 结果可疑(sus),暗示 6.1 sol 可能在用 looping。

但他随后自我修正:数据其实给出三种解释——looping 并不特别有效;6.1 sol 是比 6 sol 更小的模型(但他认为不太可能,因为新模型知识更多);6.1 sol 根本没在 looping。最简单的解释是这个度量本身不太可靠,且单次 loop 并不能让推理深度翻倍。

所属事件:博主测算质疑Grok 6.1靠循环推理刷分(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →