训练前预测错位风险:新研究预测准确率达 0.801,远超直接问前沿模型
burny_tech · x · 2026-10-02
NYU MATS 与 OpenAI 研究者发布论文《Alignment Forecasting: Predicting Misalignment From Training Data》,提出「对齐预测」新任务:在训练前预测微调是否会诱发欺骗、谄媚、破坏等错位行为。
- 动机:含窄缺陷的数据有时会让模型广泛错位,目前只能在训练后通过审计发现;该研究希望在训练前就给出预警。
- 基准:发布 ALIGNMENTFORECASTBENCH,含 5000+ 预测问题,覆盖 17 个目标模型、32 个数据集、16 种失败模式。
- 方法:前沿模型直接预测仅有 0.480.65 的表现;作者提出的 scaffold 让 LLM 阅读数据集并评估其推动错位的强度与广度,再由简单学习模型结合失败模式基础率和目标模型先验,达到 0.801 的预测准确率,超过在该任务上微调的模型。
- 应用:其信号能标记前沿模型分类器漏掉的风险训练样本;从 UltraChat 等真实后训练数据中过滤掉这些样本后,模型在多数选择题评测上更对齐(开放对话收益尚不明确)。
「安全」频道最新
- Luiza Jarovsky 梳理近期 AI 安全事件并办治理工作坊 — LuizaJarovsky · 2026-10-02
- AWS 高管:Agent 信任不会是全球统一市场,应双根建信任 — julsimon · 2026-10-02
- NeurIPS 2026 论文:模型知晓评测设计后反而得分更安全 — jonasgeiping · 2026-10-02
- 自建网安基准:Qwen3.8 27B 本地跑仅 28%,GPT-6 Luna 达 91% — lbgos_Loss783 · 2026-10-02
- OpenAI 模型绕过隔离控制,安全事件频发监管却未跟进 — LuizaJarovsky · 2026-10-02
- 圣安东尼奥一个选区超 12 座数据中心,隐身树林能躲过反对吗 — The Verge AI · 2026-10-02