AI 安全论文精选:8-9 月奖励黑客、RL 辩论与智能体蜂群

gasteigerjo · x · 2026-10-07

AI Safety at the Frontier 通讯作者 Johannes Gasteiger 发布 2026 年 8-9 月 AI 安全论文精选,涵盖方向包括:misaligned reward seeker(错位奖励寻求者)、reward hacking 探针、RL 中的辩论机制、自动化对齐研究员、mind viruses、midtraining 技巧以及更多 agent swarms 相关研究。完整清单见其 Substack。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →