澄清关于R1-RL与中间Token的认知误区
作者指出了社区在理解 R1-RL 和中间 token 时存在的诸多混淆,强调不应将中间 token 的长度直接等同于问题的复杂度。讨论突出了受控实验、可检查轨迹以及相关性断裂的重要性,并警告模型可能会在用户心中制造“错误的信任感”。
2026-07-15 ~ 2026-07-15 · 4 条相关
- 控制实验与可检查轨迹 — rao2z · 2026-07-15
- R1-RL和中间token的混淆 — rao2z · 2026-07-15
- 别把中间token长度当复杂度 — rao2z · 2026-07-15
- 警惕错误信任 — rao2z · 2026-07-15