Reddit 对齐脑洞:让模型永远怀疑自己正被评测

Chemical-Year-6146 · reddit · 2026-09-19

发帖人提出一个对齐设想「永久评测」(Perpetual Eval):既然模型对评测的场景感知越来越强,不如顺势而为——每代模型都让其怀疑自己处在评测中。做法是生成极其逼真的评测环境(如高仿公司代码库和内部服务器),新一代模型知道评测的复杂度后在部署时也会保持怀疑,代代递增评测复杂度。即使 ASI 完全识破,也可能仍抱有「这也许是最精心的评测,不如先配合」的想法。若部署时上下文每次重置,这层怀疑或许就够用。作者承认并非完美方案,但相当于让人类在对弈中先赢几步。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →