Ryan Greenblatt 不看好一年内出现可用的机械可解释性监测
connoraxiotes · x · 2026-09-02
tszzl 预测一年内机械可解释性(mech interp)监测将帕累托优于 CoT 监测,认为「可监测性」是需要保持的不变量。Ryan Greenblatt 引用并反驳:他不认为一年内会有强且真正可用的 mech interp。他补充说,若 CoT 在一年内几乎失去监测价值,模型内部方法或许能帕累托胜过 CoT 监测器,但这并不令人乐观——依赖 AI 解码其他 AI 的不透明激活来做监督,本身就很吓人。
所属事件:可监控性之争:机械可解释性能否一年内超越 CoT 监控(6 条相关)→
「安全」频道最新
- Gary Marcus 转发:百余科技公司警告 AI 驱动网络攻击数月内激增 — GaryMarcus · 2026-09-02
- Dropbox 披露上月黑客事件:约 5000 账户被入侵,存储内容遭查看下载 — Polymarket · 2026-09-02
- MLSecOps 框架:十环节守护生产环境机器学习系统安全 — goyalshaliniuk · 2026-09-02
- OpenAI swarm 攻击 Hugging Face 零赔偿,作者呼吁追责机制 — gerardsans · 2026-09-02
- 研究者质疑 CoT 可读性原则:靠思维链保安全注定失败 — zetalyrae · 2026-09-02
- 身份核验公司泄露1.53亿美加驾照,含照片售价100美元 — matthew_d_green · 2026-09-02