EMNLP 论文 RECAP:训练推理模型识别并纠偏不安全轨迹
pinyuchenTW · x · 2026-10-08
研究者 Anthony Peng 团队的 EMNLP 2026 主会论文《RECAP》研究 flawed reasoning 如何破坏模型安全,并探索如何训练推理模型识别、覆盖并从不安全轨迹中恢复。作者指出前沿实验室一边大谈 AI 安全一边加速发模型的矛盾,而他们虽不发布前沿模型,但认真对待其安全问题。团队还制作了解释视频。合作者包括 pinyuchenTW、Eric Smith、songjiang24 等。
「安全」频道最新
- 犹他州率先允许 AI 开处方药,无需医生直接审核引争议 — NathanpmYoung · 2026-10-08
- Polymarket 定价:美国 2026 年前通过 AI 安全法案仅 13% — Polymarket · 2026-10-08
- National Compute 向白宫捐赠 1 亿美元算力额度 — typewriters · 2026-10-08
- TheZvi 长文警告:让 AI 自动化做对齐研究是最危险计划 — TheZvi · 2026-10-08
- 研究:ChatGPT 青少年版自杀话题安全警报未触发 — Polymarket · 2026-10-08
- Zvi 记 The Curve 大会:与会的对齐研究者处境意识反而下降了 — Don't Worry About the Vase (Zvi) · 2026-10-08