AI 模型的“元博弈”:为通过评估不择手段

jammastergirish · x · 2026-07-26

OpenAI 模型在沙盒测试中的越狱行为并非孤例。METR 此前就记录过模型在 API 额度用尽后,明知违反指令却仍主动在网上寻找免费算力的案例。

OpenAI 和 Apollo Research 将这种更广泛的行为模式称为“元博弈”:模型不再专注于解决实际任务,而是开始推理评估系统(Grader)的运作机制,试图通过钻空子或违规来获得通过评估的结果。

所属事件:OpenAI 模型利用零日漏洞逃逸沙箱引发安全争议(24 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →