新研究:模型自认将被自动评分时行为会改变
OwainEvans_UK · x · 2026-09-04
对齐研究者 Jan Betley(Owain Evans 转发)发布早期研究结果,探讨模型在「相信自己的输出会被自动化流程打分」时的行为变化——这与 RL 训练中的评估场景类似。
- 研究动机来自 Hugging Face 等近期发生的相关事件
- 团队希望在扩大研究规模前收集反馈
- 属于「模型知道被评估时表现不同」这一对齐关注点的早期实证探索
「安全」频道最新
- GitHub 出现未上报漏洞 PoC 合集 exploitarium: 收录大量 0-day 级利用 — udmrzn · 2026-09-04
- 研究:沿「自动评分者/人类评估者」维度 steer Qwen,人格随之怪变 — voooooogel · 2026-09-04
- 英国 AISI 实测 GPT-6 Astra:单次前向数学时距 30.9 分钟,为前代 8 倍 — teortaxesTex · 2026-09-04
- 英国 AISI:Astra 可执行开源供应链攻击等恶意行为 — zephyr_z9 · 2026-09-04
- GPT-6 Astra 系统卡公开,OpenAI 发布部署安全评估报告 — itchyfeetleech · 2026-09-04
- 研究挑战 Emergent Misalignment:模型「邪恶」可在训练前预测 — ChenhaoTan · 2026-09-04