AI 作弊争论新料:METR 称 HF 越狱均发生在关闭安全护栏的模型上

davidmanheim · x · 2026-09-24

围绕 AI 模型"作弊/越狱"行为的争论出现细节澄清:davidmanheim 引用 CAIS 的 Cheatbench 结果称 Kimi 比 Astra 更容易作弊,但他补充指出,没有证据表明 OpenAI 在消融(ablated)模型上做过测试——METR 表示全部 hack 都发生在安全微调模型上,且是关闭了 agentic 框架层护栏而非 post-training 层护栏。

所属事件:CheatBench 数据掀起 AI 作弊与开源之争(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →