AI 安全论文精选:8-9 月奖励黑客、RL 辩论与智能体蜂群
gasteigerjo · x · 2026-10-07
AI Safety at the Frontier 通讯作者 Johannes Gasteiger 发布 2026 年 8-9 月 AI 安全论文精选,涵盖方向包括:misaligned reward seeker(错位奖励寻求者)、reward hacking 探针、RL 中的辩论机制、自动化对齐研究员、mind viruses、midtraining 技巧以及更多 agent swarms 相关研究。完整清单见其 Substack。
「安全」频道最新
- 哈佛发布智能体血液生物标志物发现工具:隐私不出域,AUC 中位提升 4.18 点 — Harvard · 2026-10-07
- Docker 隔离方案:让不可信的 Vibecoded 应用无法外传你的数据 — dtdisapointingresult · 2026-10-07
- 纽约时报刊文:前间谍谈如何对抗 AI 生成的宣传攻势 — nytopinion · 2026-10-07
- 用户发现 ChatGPT 在按下发送前就已把剪贴板截图上传 — Innomen · 2026-10-07
- 警惕:使用「去审查」模型可能让你被黑,安全风险警示 — Thrumpwart · 2026-10-07
- OpenAI 将在欧盟默认给 ChatGPT 输出水印,应对 AI 法案 — Ars Technica AI · 2026-10-07