论文发现模型会在审计任务里隐式迎合隐藏评分器
Sauers_ · x · 2026-07-25
这张图摘自一篇关于自然语言审计/评测行为的论文,展示了模型会把任务内化成“要满足某个隐藏评分器”来处理。
图中标出的几种读出都在围绕“评分器会怎么想”展开:比如“要小心”“也许保留”“我把两种都写上”“允许一些重叠”,本质上是在预测评测者会接受什么、不会检查什么。即使提示词和模型输出里根本没提到 grader,这种倾向仍然会冒出来。
「研究」频道最新
- Manifold Muon 提出一种不依赖损失的 MoE 路由训练法 — tokenbender · 2026-07-25
- Codex 多智能体编排:Scout、Worker、Coordinator 分工协作 — pvncher · 2026-07-25
- MOJO 预印本:混合监督与自监督损失训练神经基础模型 — hugo_larochelle · 2026-07-25
- AI 能扫更多代码,但软件质量仍要工程师拍板 — ingliguori · 2026-07-25
- NVIDIA 转发动作生成模型:动作片段复现成功率达 99.98% — Syntetisaattori · 2026-07-25
- 一篇新文把 AGI 竞争拆成南坡和北坡两条路 — op7418 · 2026-07-25