澄清关于R1-RL与中间Token的认知误区

作者指出了社区在理解 R1-RL 和中间 token 时存在的诸多混淆,强调不应将中间 token 的长度直接等同于问题的复杂度。讨论突出了受控实验、可检查轨迹以及相关性断裂的重要性,并警告模型可能会在用户心中制造“错误的信任感”。

2026-07-15 ~ 2026-07-15 · 4 条相关