gleech 补充:行为审计干净不等于未来六个月不会出格
gleech · x · 2026-09-23
在评价 Anthropic 对 Claude Opus 5.5 的自动化行为审计时,gleech 补充指出报告的隐含推论不成立:即便 5.5 在几乎所有指标上拿到最干净的审计结果,也不能因此预期它在未来六个月内不会出现出格行为——因为同期的 Mythos 模型在这些指标上同样拿到了干净的结论,但安全表现仍可能随时间和场景漂移。
「模型」频道最新
- Claude Opus 5.5 新增时间预算功能:可指定模型在一项任务上工作多久 — JeremyNguyenPhD · 2026-09-23
- 小米开源 MiMo-V2.6-Pro:1.02 万亿参数 MIT 协议,附训练代码与 RL 环境 — emmanuelvivier · 2026-09-23
- 阿里拟训练 5 到 10 万亿参数 Qwen 模型,Qwen 4 已在训练中 — emmanuelvivier · 2026-09-23
- 传 Anthropic 发布 Claude Opus 5.5:成本降 40%,对标 Fable 5.1 — emmanuelvivier · 2026-09-23
- OpenAI 发布 GPT-6 Sol 与 Luna,价格减半、代码与电脑操作错误更少 — emmanuelvivier · 2026-09-23
- OpenAI 推出 GPT-6 Sol 与 Luna:价格砍半,代码与工具使用错误更少 — emmanuelvivier · 2026-09-23