OpenAI 研究员:GPT-6 思维链可控性随 RL 训练持续上升

gleech · x · 2026-09-04

OpenAI 研究员 Tomasz Korbak(被 1a3orn 引用)透露的一项发现:GPT-6 的 CoT(思维链)可控性在 RL 训练过程中持续上升,而此前几代模型并非如此,且这种可控性与模型的 no-CoT 能力在多代模型间强相关。

他正在研究这一上升的根因。转发者 1a3orn 评价这是一个「相当大且不太妙」的更新——思维链监控的可信度问题正变得更复杂,值得安全研究者关注。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →