EMNLP 论文 RECAP:训练推理模型识别并纠偏不安全轨迹

pinyuchenTW · x · 2026-10-08

研究者 Anthony Peng 团队的 EMNLP 2026 主会论文《RECAP》研究 flawed reasoning 如何破坏模型安全,并探索如何训练推理模型识别、覆盖并从不安全轨迹中恢复。作者指出前沿实验室一边大谈 AI 安全一边加速发模型的矛盾,而他们虽不发布前沿模型,但认真对待其安全问题。团队还制作了解释视频。合作者包括 pinyuchenTW、Eric Smith、songjiang24 等。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →