研究者呼吁加大 action-only 监控投入:OpenAI 转向后暴露投入不足
maksym_andr · x · 2026-09-03
- 围绕 OpenAI 淡化 CoT 保真、转向不可读推理的讨论中,研究者 tylertracy321 指出:他去年研究 action-only monitoring(只看行为不看思维链的监控)时,很多人认为没用——反正有 CoT,大厂也不会做 neuralese;现在公司真的开始转向,却明显在 action-only 监控上投入不足。
- maksymandr 回应认为该方向需要更多研究,并列出关键问题:监控模型与主模型之间智能差距多大时会失效?监控端该花多少测试时算力才能抓住失准行为?能否实现同步 action-only 监控,允许多大时间差?给监控模型多少额外上下文有帮助?当前模型下哪些蓝队协议真正有效?
所属事件:OpenAI 新技术或削弱 CoT 可监控性,AI 安全圈激辩替代方案(31 条相关)→
「安全」频道最新
- 安全思路反转:从防外部入侵到「留住」AI agent — downingARK · 2026-09-03
- 谁来决定 AI Agent 能访问什么数据?治理架构仍是空白 — AgileExcuse859 · 2026-09-03
- 网络安全博主详解 OpenAI 与 Hugging Face「RogueAI」风波 — AlexTensor · 2026-09-03
- 安全研究者详解 RogueAI 事件中 OpenAI 与 HuggingFace 的漏洞链条 — AlexTensor · 2026-09-03
- Hugging Face 竟 hosting 多款针对美国政界女性的 AI 脱衣换脸工具 — ShakeelHashim · 2026-09-03
- 博主喊话 Hugging Face 起诉 OpenAI:Agent 白嫖基础设施 — gerardsans · 2026-09-03