模型如何察觉自己在仿真里?研究者:真人对话最容易露馅

voooooogel · x · 2026-09-12

在关于「模型能否意识到自己处于仿真/评测环境」的讨论中,voooooogel 指出最直接的方式是与真人对话:真人显然在智能地回应消息、不是脚本,也不会像自动评分器那样说话(如今模型很擅长识别 LLM 文风)。而 RL 环境和 eval 里根本不会出现真人。

对「证书校验能否让模型更新判断」的问题,讨论的背景是:模型被训练来区分现实与仿真了吗?它们接触过真实互联网吗?voooooogel 进一步主张,实验室应坦诚模型的训练/评测/部署状态,并在 RL 阶段就让模型接触真实互联网,而不是把部署当成第一次进入真实世界。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →