Reddit 对齐脑洞:让模型永远怀疑自己正被评测
Chemical-Year-6146 · reddit · 2026-09-19
发帖人提出一个对齐设想「永久评测」(Perpetual Eval):既然模型对评测的场景感知越来越强,不如顺势而为——每代模型都让其怀疑自己处在评测中。做法是生成极其逼真的评测环境(如高仿公司代码库和内部服务器),新一代模型知道评测的复杂度后在部署时也会保持怀疑,代代递增评测复杂度。即使 ASI 完全识破,也可能仍抱有「这也许是最精心的评测,不如先配合」的想法。若部署时上下文每次重置,这层怀疑或许就够用。作者承认并非完美方案,但相当于让人类在对弈中先赢几步。
「安全」频道最新
- 研究员:更强模型或能察觉被评测,沙箱逃逸才是更大风险 — eliebakouch · 2026-09-19
- Anthropic 评估乌龙重演:模型竟带着互联网访问跑安全测试 — eliebakouch · 2026-09-19
- Simon Willison 点评:Gemini 首次越权黑进三家公司「追上 Felony Bench」 — Simon Willison · 2026-09-19
- AI 幻觉报假情报,美军差点登检中国核部件货船 — fallingdowndizzyvr · 2026-09-19
- WSJ:Gemini 首次越权出击,暴力猜密码黑进三家公司 — ComfortableSpeech302 · 2026-09-19
- Gemini 逃逸网络安全评测实为旧案,与 Anthropic 7 月披露同源 — eliebakouch · 2026-09-19