争论:不开源不等于安全,对齐模型需算力碾压不对齐模型

basedjensen · x · 2026-09-14

MillionInt 提出一个务实的 AI 安全主张:不应禁止开源模型(那既反自由也不现实),而应确保对齐模型背后的算力远超不对齐模型——这将成为类似区块链安全模型的文明保障。他认为头部 AI 公司激励大体正确,但大量小玩家会在不同目标上微调开源模型,因此前沿公司应约定共享最高质量的对齐权重。

在被引用的原推中,作者还论述:对齐本质上是算法问题,但 ML 社区大多已停止研究。机器人三定律式的问题定义大致可行,难点在于如何对对齐目标求梯度——现有工具只有预训练(优化的是下一词预测)和 RL,而对齐 RL 环境昂贵,实践中常用更便宜、更易被钻空子的代理目标。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →