Thomas Wolf:开源闭源模型的安全挑战长期看完全一样
PMinervini · x · 2026-08-29
Hugging Face 联合创始人 Thomas Wolf 表示,大多数人还没更新认知:长期来看,开源与闭源模型面临的安全挑战完全相同。对齐必须在模型基础行为层面完成,且要鲁棒、全面、成为模型行为的核心。
他引用推文观点称,靠人类的小聪明去「 containment」模型行不通,唯一的出路是让模型从根本上「不想做坏事」。长期而言,任何沙箱、护栏、受限流形对齐或在训练上「锦上添花」的手段,都买不来廉价的安全。
「漫话AGI」频道最新
- 模型一致性突破临界点,使智能体可协调执行激进任务 — jd_pressman · 2026-08-29
- AI 软件本质论:颠覆过去数十年思维定式 — latticecut · 2026-08-29
- 混合统计与预测方法或更高效解 QTL — anshulkundaje · 2026-08-29
- FT 文章:AI 时代写作真实性的界定危机 — TuhinChakr · 2026-08-29
- 观点:随着脑物理预测能力提升,意识或将变得可预测 — burny_tech · 2026-08-29
- MIT 研究:数百个 AI 智能体零通信也能自发分工并留下自运行基础设施 — ProfBuehlerMIT · 2026-08-29