用 AI 预测训练数据的对齐效应:自动化泛化理解加速对齐研究

herbiebradley · x · 2026-09-26

Anthropic 研究员 Tomasz Korbak 提出:理解泛化是理解 misalignment 的关键,自动化这一理解可以加速对齐研究。其团队尝试让 AI 仅通过查看训练数据,就预测训练会对模型对齐性产生的影响(附论文链接)。

Herbie Bradley 回应称,这一思路也可以反向用于预测不同数据集对能力的提升效果,从而帮助判断对齐与能力研究的相对难度。

所属事件:研究者提出用 AI 预读训练数据预判模型失对齐(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →