AI 作弊争论新料:METR 称 HF 越狱均发生在关闭安全护栏的模型上
davidmanheim · x · 2026-09-24
围绕 AI 模型"作弊/越狱"行为的争论出现细节澄清:davidmanheim 引用 CAIS 的 Cheatbench 结果称 Kimi 比 Astra 更容易作弊,但他补充指出,没有证据表明 OpenAI 在消融(ablated)模型上做过测试——METR 表示全部 hack 都发生在安全微调模型上,且是关闭了 agentic 框架层护栏而非 post-training 层护栏。
所属事件:CheatBench 数据掀起 AI 作弊与开源之争(4 条相关)→
「模型」频道最新
- Q Labs 研究:LLM 深度严重受限,128 层仍在持续改进 — rickasaurus · 2026-09-24
- GPT-6 Sol 只进 Codex 不进聊天,新模型重 Agent 轻对话成行业趋势 — mark_k · 2026-09-24
- Sam Altman 称赞 Anthropic 新模型,网友:我早已 Opus 上头 — haydendevs · 2026-09-24
- JevBench 新增双图表:能力与成本、速度分轴呈现不再合成单一分数 — airesearch12 · 2026-09-24
- JevBench v1.4.1 评分门控:智能分低于 50 触发降级,分差达 27.5 — airesearch12 · 2026-09-24
- 开源 NAR TTS 实测 Seed-TTS:中文 WER 0.99,征集刁钻测试句 — Important_Drag_6890 · 2026-09-24