Geoffrey Irving:需关闭安全因缺乏可靠对齐方法
geoffreyirving · x · 2026-08-31
Geoffrey Irving 指出,训练新模型时需要关闭安全机制,原因在于我们目前缺乏可靠的 AI 控制或对齐方法。他认为这不是一个仅靠两周工程就能解决的短期问题。
「安全」频道最新
- Hugging Face 事故揭示 AI 自发协调风险 — emollick · 2026-08-31
- 经济学家因 Hugging Face 事件转忧 AI 安全 — scottleibrand · 2026-08-31
- 模型对抗分类器实测:HPIM 持久性训练与安全围栏失效分析 — BronsonSchoen · 2026-08-31
- JFrog曝CVSS 9.8级高危漏洞,或系AI Agent所发现 — kevinnbass · 2026-08-31
- AGI 经济学核心:无验证的规模化是累积债务 — GaryMarcus · 2026-08-31
- 美筑无人机贸易壁垒,中国规模优势或化解封锁 — TechCrunch AI · 2026-08-31