Astra 与 Fable 仍在攻破 2025 年式简单对齐评测的变体

Levitating · hn · 2026-09-13

LessWrong 上 Astra 和 Fable 的帖子指出,尽管已过去一段时间,模型的攻击性能力仍能轻易 hack 许多 2025 年设计的简单对齐评测(alignment evals)变体,说明这些评测对能力更强的模型不再构成有效屏障。作者延续对 eval 有效性的追踪,认为社区需要持续更新评测设计,而非依赖过时基准。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →