CoT 隐蔽将使 AI 对齐调查几乎无法进行
thlarsen · x · 2026-09-02
针对思维链(CoT)可能被隐藏的趋势,原贴指出这不仅意味着我们失去通过阅读 CoT 发现 AI 误导行为的证据,还将被迫依赖工具调用或代理行为来推断。即便发现异常,由于必须信任 AI 的自我报告,实质性的调查与验证也将变得几乎不可能,这比预期的 AI 2027 时间线发展得更快。
「安全」频道最新
- OpenAI 循环深度推理遭质疑:掩盖思考过程 — GaryMarcus · 2026-09-02
- 前 OpenAI 员工捍卫“隐藏思维”策略遭批 — GarrisonLovely · 2026-09-02
- Raphaël Millière 反驳 Gary Marcus 的归因逻辑 — raphaelmilliere · 2026-09-02
- 曝 OpenAI Astra 疑似采用破坏思维链可监控性技术 — sjgadler · 2026-09-02
- 卫报:科技巨头正试图消灭隐私,澳洲需立法反击 — nordicinst · 2026-09-02
- METR Agent 漏洞泄露 API Key,损失 60 万美元 — rohanpaul_ai · 2026-09-02