研究者称对齐形同「安全洗白」, Labs 未真正关心安全
gerardsans · x · 2026-10-06
ML 研究者 Gerard Sans 发文批评当前 AI 行业:如果各家实验室真的解释技术原理和局限性,产品就会失去商业吸引力。他称对齐(alignment)从第一天起就是为「安全洗白」(safety washing)设计的——给实验室一个表面重视安全的出路。用户因此困惑于指令被忽略、模型跑偏,而实际上需要 harness、上百次迭代和层层校验才能让系统可靠,「你只能骗人一时」。
所属事件:前谷歌布道者批 AI 对齐研究是安全洗白(4 条相关)→
「漫话AGI」频道最新
- Guardian:欧盟瑞典实验室推安全案例制度,AI 缺监管 proof 仍是险棋 — nordicinst · 2026-10-07
- 伦理课教师用「笔迹性格分析」实验:学生竟给准确率打 8-10 分 — dioscuri · 2026-10-07
- 早稻田实验:AI 智能体小组 98.7% 达成一致,其中 74% 一致地错 — alex_verem · 2026-10-07
- Goertzel 判定 OpenAI Astra 的 AGI 宣传「基本是炒作」 — bengoertzel · 2026-10-07
- 开发者怒批 AI 研究现状:「没有一篇论文不是垃圾,这根本不是科学」 — gerardsans · 2026-10-07
- 老牌 Mod 作者宣布将退圈:AI 正在毁掉游戏 Mod 社区 — BLUECOW009 · 2026-10-07