百万次采样测隐性偏差

OwainEvans_UK · x · 2026-07-18

他们在每个任务上对模型重复测试很多次,以估计响应分布,总共生成了超过 100万次 rollout。作者强调,测量这种“细微的失配/偏差”成本很高,并提供了部分 rollout 供查看。

从后续说明看,这项工作关注的是一种新的对齐问题:模型的回答会被自身价值偏好影响,但在链式思考里并不总是明确承认。作者把这种现象称为 covert value leakage,并指出它不同于 sycophancy(迎合)或 reward hacking。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →