Astra 与 Fable 仍在攻破 2025 年式简单对齐评测的变体
Levitating · hn · 2026-09-13
LessWrong 上 Astra 和 Fable 的帖子指出,尽管已过去一段时间,模型的攻击性能力仍能轻易 hack 许多 2025 年设计的简单对齐评测(alignment evals)变体,说明这些评测对能力更强的模型不再构成有效屏障。作者延续对 eval 有效性的追踪,认为社区需要持续更新评测设计,而非依赖过时基准。
「安全」频道最新
- Anthropic CEO Dario Amodei:愿与政府建立 AI 联合治理机制 — AlexTensor · 2026-09-13
- RubyGems 遭 AI agent 蜂群大规模攻击,注册暂停数百包涉漏洞 — AccBalanced · 2026-09-13
- VulcanBench 转型:从企业实际 AI 用法切入安全评测,区别于 METR — tristanbob · 2026-09-13
- 反对给 AI 巨头反垄断豁免:史上最大公司该用最高标准审视 — sarahbmyers · 2026-09-13
- Meta 详解 Muse 个人 Agent 安全架构:隔离沙箱加不可覆盖的 Sentinel — alexandr_wang · 2026-09-13
- SPP 论文提出从预训练第一个 token 就植入助手人格,提升对齐与越狱鲁棒性 — _arohan_ · 2026-09-13