研究发现 RL 训练让 CoT 可控性上升,且与无 CoT 能力强相关
tomekkorbak · x · 2026-09-04
研究员 tomekkorbak 公布其数周来的根因分析:在 RL 训练过程中,思维链(CoT)的可控性(controllability)持续上升,而此前的模型并非如此;并且跨几代模型,该指标与模型的无 CoT 能力强相关。
所属事件:DeepMind 研究员警告思维链可监控性持续下降(4 条相关)→
「研究」频道最新
- 大模型+局部潜空间模型,让机器人策略在世界模型内学会富接触操作 — chris_j_paxton · 2026-09-04
- AML_aP 2026 主题演讲:人类与 LLM 的预测机制异同 — tallinzen · 2026-09-04
- AIMS Ghana 团队发布两阶段深度学习框架检测新生儿脑部病变 — Dr_Alex_Crimi · 2026-09-04
- 在 1997 年 GTA 自由城里跑疫情模拟:关掉商场就能压平曲线 — TivadarDanka · 2026-09-04
- 语义缓存验证器红队测试:84% 对抗样本被放行,混入对抗数据降至 54% — Reasonable_Royal_621 · 2026-09-04
- TACL 新政:图表须可读,附录限 5 页,不合格直接桌拒 — EhudReiter · 2026-09-04