研究发现 RL 训练让 CoT 可控性上升,且与无 CoT 能力强相关

tomekkorbak · x · 2026-09-04

研究员 tomekkorbak 公布其数周来的根因分析:在 RL 训练过程中,思维链(CoT)的可控性(controllability)持续上升,而此前的模型并非如此;并且跨几代模型,该指标与模型的无 CoT 能力强相关。

所属事件:DeepMind 研究员警告思维链可监控性持续下降(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →