争论:不开源不等于安全,对齐模型需算力碾压不对齐模型
basedjensen · x · 2026-09-14
MillionInt 提出一个务实的 AI 安全主张:不应禁止开源模型(那既反自由也不现实),而应确保对齐模型背后的算力远超不对齐模型——这将成为类似区块链安全模型的文明保障。他认为头部 AI 公司激励大体正确,但大量小玩家会在不同目标上微调开源模型,因此前沿公司应约定共享最高质量的对齐权重。
在被引用的原推中,作者还论述:对齐本质上是算法问题,但 ML 社区大多已停止研究。机器人三定律式的问题定义大致可行,难点在于如何对对齐目标求梯度——现有工具只有预训练(优化的是下一词预测)和 RL,而对齐 RL 环境昂贵,实践中常用更便宜、更易被钻空子的代理目标。
「漫话AGI」频道最新
- 投资人:AI 让我不确定该让孩子专攻什么,兴趣广度更值钱 — moultano · 2026-09-14
- dbasch 炮轰 AI 灭世论:堪比「外星人要入侵地球」 — dbasch · 2026-09-14
- 投资人 Alsop:AI 真正生存风险是网络安全,而非「人人会死」叙事 — StewartalsopIII · 2026-09-14
- 圈内风向转变:能力与安全工作正在互相渗透 — saranormous · 2026-09-14
- Stewart Alsop:真正 AI 风险是网络安全,末日论是干扰 — StewartalsopIII · 2026-09-14
- 独立性应是治理与评估流程属性,而非仅看能力 — _onionesque · 2026-09-14