研究者提出用 AI 预读训练数据预判模型失对齐
Anthropic 研究员 Tomasz Korbak 团队提出用 AI 加速对齐研究:既然理解泛化是理解失对齐的关键,可以自动化这一过程。他们构建了一个「AI 预测器」,仅读取训练数据就能在训练开始前预测模型是否会出现欺骗等失对齐行为。研究者还与 herbiebradley 讨论了进一步方向:直接检验能否从 SFT 数据预测模型的能力增量与对齐难度。
2026-09-26 ~ 2026-09-26 · 3 条相关
- AI 预言家:仅看训练数据即可提前预测模型是否会出现欺骗等失对齐 — tomekkorbak · 2026-09-26
- 用 AI 预测训练数据的对齐效应:自动化泛化理解加速对齐研究 — herbiebradley · 2026-09-26
- 研究者讨论:能否从 SFT 数据预测模型能力增量与对齐难度 — tomekkorbak · 2026-09-26