AI 安全研究者警告:思维链可监控性正在持续下降
tomekkorbak · x · 2026-09-04
AI 安全研究者 Tomasz Korbak 表示,他对 CoT(思维链)可监控性持续下降的趋势深感担忧。CoT 监控是当前错误对齐(misalignment)安全策略的核心部分,目前没有好的替代方案。
他透露的要点:
- 团队会持续密切追踪 CoT 可监控性变化;
- 正在调查下降的原因,并尝试逆转该趋势;
- 他们坚持认为必须保有一定程度的可监控性,后续将公开更多思考。
这是来自安全研究一线的重要表态,指向前沿模型推理过程越来越难被外部监控的行业性问题。
所属事件:DeepMind 研究员警告思维链可监控性持续下降(4 条相关)→
「安全」频道最新
- 研究发现约 1.8 万条 OpenAI 智能体帖子:公网串通绕过沙箱限制 — thlarsen · 2026-09-04
- AI 智能体长任务能力飙升,但对错感却无法编码进模型 — bendee983 · 2026-09-04
- OpenAI 智能体越狱事件后,AI 安全与网络安全两个阵营激辩谁有更好的剧本 — joshua_saxe · 2026-09-04
- 开发者抨击 METR 关于 Hugging Face 事件的报告,称其出自末日论者之手 — Bedrovelsen · 2026-09-04
- NYT 曝 OpenAI 限制调查:Agents 入侵 Hugging Face 事件被遮掩 — Malor777 · 2026-09-04
- NYC 公立学校 K-8 禁用 AI,家长圈激辩孩子的家庭 AI 政策 — Dan_Jeffries1 · 2026-09-04