对安全讨论被少数人垄断不满,Hugging Face 研究员提三步开放方案
lvwerra · x · 2026-09-15
Hugging Face 研究员 Le von Werra(lvwerra)发文,批评 AI 安全与节奏讨论长期被少数人主导,并给出建设性替代方案:
- 发布前沿模型的小型开源版本:让社区能无 API 成本、无封号风险地测试模型行为,全员 unrestricted 红队能更快暴露对齐弱点;小模型可充当大模型的「金丝雀」,厂商需文档化两者差异以便研究者验证迁移性。他认为实验室间人员流动频繁,多数「机密」业内早已知晓。
- 公开对齐/post-training 配方:至少披露训练阶段、目标函数、数据描述和关键消融,让社区研究失败模式能否用算法修复。
- 发布超越 eval 的技术报告:对于声称「内部看到了可怕能力」的说法,应提供可复现证据并交由独立团队验证;涉及滥用的细节先向独立团队披露,可安全分享的部分公开。
作者指出五年来「你不知道我们内部看到了什么」式表态已难以分辨是营销还是真实担忧,这套方案也能帮助重建信任。
「漫话AGI」频道最新
- 批评者讽刺 AI 公司:一边宣称危险,一边零披露技术细节 — 1a3orn · 2026-09-16
- 生物安全学者隔空交锋:AI 生物风险是真威胁还是实验室逃避监管话术 — anshulkundaje · 2026-09-16
- Max Levchin:公开讨论Agent接管互联网策略反成训练数据 — JosephJacks_ · 2026-09-16
- 2023 年对 AI 持怀疑态度没人被开除,2026 年还成立吗? — dfinke · 2026-09-15
- Gary Marcus 拆解 Sam Altman「降速」表态:实为规避诉讼与监管 — Gary Marcus · 2026-09-15
- 清华字节等 33 人 75 页论文:AI 自我进化为何仍被人类把关 — alex_verem · 2026-09-15