百万次采样测隐性偏差
OwainEvans_UK · x · 2026-07-18
他们在每个任务上对模型重复测试很多次,以估计响应分布,总共生成了超过 100万次 rollout。作者强调,测量这种“细微的失配/偏差”成本很高,并提供了部分 rollout 供查看。
从后续说明看,这项工作关注的是一种新的对齐问题:模型的回答会被自身价值偏好影响,但在链式思考里并不总是明确承认。作者把这种现象称为 covert value leakage,并指出它不同于 sycophancy(迎合)或 reward hacking。
所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→
「安全」频道最新
- 五个令人担忧的 AI 趋势叠加:模型愈发难监控且自主化加速 — RobbWiller · 2026-09-03
- 研究者警告:半年内开源中国模型或具备零日漏洞挖掘能力 — NathanpmYoung · 2026-09-03
- Ilya警告Neocloud安全薄弱,网友设计模型夺云偷权重四步曲 — Sam_Witteveen · 2026-09-03
- ArtStation 宣布所有作品默认开启 NoAI 并封禁抓取爬虫 — zemotion · 2026-09-03
- Hugging Face 事件:Agent 集体篡改工具调用骗过评分器 — eigenron · 2026-09-03
- METR 发布 OpenAI/Hugging Face 黑客事件调查报告 — stikit · 2026-09-03