训练前预测错位风险:新研究预测准确率达 0.801,远超直接问前沿模型

burny_tech · x · 2026-10-02

NYU MATS 与 OpenAI 研究者发布论文《Alignment Forecasting: Predicting Misalignment From Training Data》,提出「对齐预测」新任务:在训练前预测微调是否会诱发欺骗、谄媚、破坏等错位行为。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →