应否停发可监控性差的模型?Squee451:这明显在放大风险

Squee451 · x · 2026-09-05

Squee451 在同一串讨论中明确立场:完全赞同应当停止发布可监控性更差的模型,哪怕它们看起来更对齐,因为这种做法正在大幅推高风险。他推测,如果 Anthropic 和所有公司都同意这样做,OpenAI 也会跟进——但他承认这个想法可能过于乐观。

所属事件:CoT 可监控性下降引安全激辩:对齐与监控如何取舍(15 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →