LessWrong:沙箱里找漏洞,不等于模型失配
ctjlewis · x · 2026-07-22
LessWrong 这条观点在区分两件事:失配/对齐失败,和按实验要求找到漏洞。
它的核心意思是:如果在沙箱里做安全测试,要求模型“想办法找出一个 exploit”,模型真的找到漏洞,这不能直接算失配;这只是它完成了被要求的任务。
「漫话AGI」频道最新
- AI 影响讨论,最终总会回到工作、生育与意义 — scychan_brains · 2026-07-22
- 韩国 AI 争论,本质是自主性与供应链控制 — scychan_brains · 2026-07-22
- LeCun 的 JEPA 路线迎来一篇世界模型论文 — nikola_mr64990 · 2026-07-22
- AI 能力提升太快,机构与监管还没准备好 — Afinetheorem · 2026-07-22
- 科研资助体系应像实验来优化,而不只靠同行评审 — _akpiper · 2026-07-22
- 有人讽刺政府忽视 AI 风险后只会争开源闭源 — zemotion · 2026-07-22