观点:强制 CoT 可读性可能削弱 LLM 对齐

JacquesThibs · x · 2026-09-02

Jacques Thibault 分享了对 AI 安全社区普遍推崇的“思维链监控”的反对意见。他认为,强制模型生成额外可读的 CoT 实际上可能会使 LLM 的对齐变得更差,同时指出很难看出外部安全技术如何有效迁移到内部。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →