「推理深度」估算揭示 Sol 6.1 疑似在 looping,但测量方法本身可能不可靠
scaling01 · x · 2026-09-30
博主用一项「真实推理深度」估算做了「spot the looper」分析:5.6 luna/sol 和 6 luna/sol 都测不出 looping 迹象,而 6.1 sol 和 6 astra 结果可疑(sus),暗示 6.1 sol 可能在用 looping。
但他随后自我修正:数据其实给出三种解释——looping 并不特别有效;6.1 sol 是比 6 sol 更小的模型(但他认为不太可能,因为新模型知识更多);6.1 sol 根本没在 looping。最简单的解释是这个度量本身不太可靠,且单次 loop 并不能让推理深度翻倍。
所属事件:博主测算质疑Grok 6.1靠循环推理刷分(3 条相关)→
「模型」频道最新
- Anthropic 评估 GLM-5.3:越狱成功率 64%-100%,网络攻击能力无有效护栏 — BasedRaddka · 2026-09-30
- ChatGPT Pro 订阅被曝附赠 6.25 万 Codex 额度,年底过期 — chaumian · 2026-09-30
- 用户算账:62500 积分仅值约 2500 美元 GPT-6.1 API 用量,额度大缩水 — chaumian · 2026-09-30
- 有 Pro 订阅用户称账户突然到账 62500 额度,约为月度 15 倍 — IronDarbe · 2026-09-30
- 用户质疑:ChatGPT 经典聊天模式为何拿不到最新 GPT 模型 — koltregaskes · 2026-09-30
- 用户账号到账 62500 积分,名义价值约 2500 美元 — kimmonismus · 2026-09-30