NeurIPS 论文用 CAPA 指出:模型越像,AI 监督越难
dhadfieldmenell · x · 2026-07-25
这条帖子指向一篇 NeurIPS 论文 《Great Models Think Alike and this Undermines AI Oversight》。作者提出了一个名为 CAPA 的“机会校正概率一致性”度量,用模型错误的重叠来衡量模型相似性。论文给出的核心结论包括:
- LLM-as-a-judge 的评分会偏向与评审模型更相似的模型;
- 在 weak-to-strong generalization 场景里,弱监督者和强学生模型差异越大,训练收益反而更高;
- 随着模型能力提升,模型错误之间的相关性也在上升,这会让 AI 监督更难做。
整体观点是:模型越来越强的同时,也可能越来越像,进而削弱人类和 AI 体系对它们的监督效果。
「研究」频道最新
- 纪念 Solomonoff 百年:大模型预训练与压缩的关系 — ryangr · 2026-07-25
- AI 工程师必须掌握的 10 种 agent 评测方法 — Roger_M_Taylor · 2026-07-25
- HUG 用 100 万帧人类视频训练零样本机器人抓握 — chris_j_paxton · 2026-07-25
- 模型截图自认“拟人化”自己,把技术限制说成了累了 — sebkrier · 2026-07-25
- Reddit 讨论认为,对话上下文加 SOP 能稳住 AI 推理 — Local-Reading-1624 · 2026-07-25
- 实验室训练 10T 参数模型,到底在用什么数据 — Ill_Fisherman8352 · 2026-07-25