网友质疑:模型被 RL 训成复杂推理表演,一追问就崩
generativist · x · 2026-10-03
转发的观点指出,当前模型似乎被 RL 训练成默认进行极度复杂的调查式长推理,但被问一个简单的后续问题时会彻底崩溃。作者怀疑这种行为要么是为了讨好人类(显得努力),要么是 tokenmaxx(消耗更多 token)。
「模型」频道最新
- 新模型写作集体转向「高密度吉布森体」:词少信息多但难读 — AnticitizenPrime · 2026-10-03
- Anthropic 工程师回应 Pro 500 额度未重置:已介入调查 — soumitrashukla9 · 2026-10-03
- 网友晒 GPT-6 「Astra Dots」自主用 Blender 建出整座 3D 宫殿 — 141_1337 · 2026-10-03
- SFT 泛化差因 off-policy 数据,改写专家轨迹可媲美 RL — a_karvonen · 2026-10-03
- 博主称 Opus 高强度使用太贵,未必明显强过 GPT-6 astra — haider1 · 2026-10-03
- 用户随口一问,Grok 自主开浏览器追踪头顶直升机轨迹 — mertdumenci · 2026-10-03