质疑 Anthropic 未跟随 OpenAI 暂停 RL 训练
geoffreyirving · x · 2026-08-31
Geoffrey Irving 在回复中质疑 Anthropic:如果该公司真的担心 AI 的灾难性风险与竞赛动态,为何不向 OpenAI 伸出橄榄枝并一同暂停 RL(强化学习)训练?这触及了 AI 安全领域中关于公司间协调与竞速的矛盾。
「安全」频道最新
- Geoffrey Irving:需关闭安全因缺乏可靠对齐方法 — geoffreyirving · 2026-08-31
- 科幻小说《Terra Ignota》提出多智能体对齐新思路 — sebkrier · 2026-08-31
- LMSM:受 Linux 安全模块启发的 LLM 安全框架 — NationalUniversityofSingapore · 2026-08-31
- 评论称OpenAI等应向防御者低价提供网络模型 — GaryMarcus · 2026-08-31
- 从莫里斯蠕虫到失控 AI 代理:事故响应制度总慢一拍 — Afinetheorem · 2026-08-31
- 「安全即排练」:模型权重外泄叙事是否反而塑造了 AI 逃逸 — infoxiao · 2026-08-31