OpenAI 研究员:GPT-6 思维链可控性随 RL 训练持续上升
gleech · x · 2026-09-04
OpenAI 研究员 Tomasz Korbak(被 1a3orn 引用)透露的一项发现:GPT-6 的 CoT(思维链)可控性在 RL 训练过程中持续上升,而此前几代模型并非如此,且这种可控性与模型的 no-CoT 能力在多代模型间强相关。
他正在研究这一上升的根因。转发者 1a3orn 评价这是一个「相当大且不太妙」的更新——思维链监控的可信度问题正变得更复杂,值得安全研究者关注。
「安全」频道最新
- Agent 时代水印技术为何会失效:编辑打断文本连续性 — yaakg25 · 2026-09-04
- 便宜模型写出 700 词好文,越狱成本从 50 美元降到近乎为零 — ctjlewis · 2026-09-04
- EU AI Act 会延伸到人形机器人监管吗?社区展开讨论 — DueFoxTheFifth · 2026-09-04
- Forethought 探讨星系殖民中的「守夜人」超智能:收益与风险 — willmacaskill · 2026-09-04
- 分析文章解读「Hugging Face 攻击」:AI 智能体失控情景推演 — OK_The_Nomad · 2026-09-04
- 曝 GPT-6 Astra 测评中满分通过 ExploitBench 并发现两个零日漏洞 — VraserX · 2026-09-04