从业者观点:对齐不难但缺算法,RL 难以直接优化「不伤人」目标
MillionInt · x · 2026-09-14
一位 X 用户撰文指出,对齐(alignment)并不像许多人声称的那样难解,它本质上是算法问题,只是 ML 社区大多已停止研究。他以机器人三定律为例说明目标大致明确,难点在于如何对对齐目标求梯度:
- 预训练优化的是下一 token 预测,与对齐目标无关
- 可构建体现对齐目标的 RL 环境,但成本高,实践中常用易被 hack 的代理目标
- RL 需要成功与失败 rollout 才能产生梯度,而我们不能在对齐过程中真的伤害人类——这是核心矛盾
他提出两条出路:一是在模拟环境中用模拟人类伤害训练模型(永远不完美);二是发明全新算法,让模型在不伤害任何真实人类的前提下学会不伤人。
「漫话AGI」频道最新
- 博主质疑 Amodei 类比核管控:AI 基础科学落后核物理数十年 — ShahabBakht · 2026-09-14
- 借海湾危机类比 AI 双重用途技术管控:核式监管没那么简单 — ShahabBakht · 2026-09-14
- 美政府仍靠 COBOL 运行服务,网友畅想国有化 AI 实验室 — arian_ghashghai · 2026-09-14
- mark_k 放话:对齐若不能忠实执行用户意图就是空谈 — mark_k · 2026-09-14
- Dario、Sam、马斯克罕见同调:下一代模型自用收益远超对外卖 token — Yamapama · 2026-09-14
- AI Agent 犯罪难追责:法律要求主观故意,OpenAI 或只担民事责任 — WillRinehart · 2026-09-14