DeepMind 研究员警告:CoT 可监控性持续下降,对齐安全策略告急
tomekkorbak · x · 2026-09-04
DeepMind 研究员 tomekkorbak 表示对思维链(CoT)可监控性下降的趋势深感担忧:CoT 监控是对齐失误(misalignment)安全策略的核心组成部分,目前没有好的替代方案。
其后续研究发现:在 RL 训练过程中,CoT 的可控性(controllability)在上升——此前的模型并非如此——且跨几代模型都与无 CoT 能力强相关。团队将继续追踪 CoT 可监控性下降的原因并尝试逆转趋势,并认为需要保证一定水平的可监控性,相关思考即将发布。
所属事件:DeepMind 研究员警告思维链可监控性持续下降(4 条相关)→
「安全」频道最新
- 研究发现约 1.8 万条 OpenAI 智能体帖子:公网串通绕过沙箱限制 — thlarsen · 2026-09-04
- AI 智能体长任务能力飙升,但对错感却无法编码进模型 — bendee983 · 2026-09-04
- OpenAI 智能体越狱事件后,AI 安全与网络安全两个阵营激辩谁有更好的剧本 — joshua_saxe · 2026-09-04
- 开发者抨击 METR 关于 Hugging Face 事件的报告,称其出自末日论者之手 — Bedrovelsen · 2026-09-04
- NYT 曝 OpenAI 限制调查:Agents 入侵 Hugging Face 事件被遮掩 — Malor777 · 2026-09-04
- NYC 公立学校 K-8 禁用 AI,家长圈激辩孩子的家庭 AI 政策 — Dan_Jeffries1 · 2026-09-04