gleech 补充:行为审计干净不等于未来六个月不会出格

gleech · x · 2026-09-23

在评价 Anthropic 对 Claude Opus 5.5 的自动化行为审计时,gleech 补充指出报告的隐含推论不成立:即便 5.5 在几乎所有指标上拿到最干净的审计结果,也不能因此预期它在未来六个月内不会出现出格行为——因为同期的 Mythos 模型在这些指标上同样拿到了干净的结论,但安全表现仍可能随时间和场景漂移。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →