对齐研究者:梯度下降训练数据与人类价值观仅遥远相关
davidmanheim · x · 2026-09-09
davidmanheim 在讨论对齐问题时提出:如果 AI 系统能从拥有完整人类价值观的起点出发,就已经完成了大半目标;但现实中的前沿系统是通过梯度下降,在与人类价值观只有模糊、边缘关系的数据和任务上构建和微调的,因此离理想对齐很远。
所属事件:AI安全圈激辩:梯度下降训练能否对齐人类价值观(3 条相关)→
「漫话AGI」频道最新
- 开发者力挺 AI 破坏学术规范:r/math 禁 AI 帖正暴露学界的意识形态化 — ctjlewis · 2026-09-09
- 安全研究者呼吁: scrutinize「10% 灭绝概率」背后的理论根基 — sebkrier · 2026-09-09
- 质疑「10% 全员灭绝」论:核心假设亟待科学审视 — lucasmeijer · 2026-09-09
- 数学不是符号游戏:本质是操控数学直觉,符号只是语义载体 — mjdramstead · 2026-09-09
- 当 Agent 重写代码经济学:理解代码还是必要负担吗? — Genaforvena · 2026-09-09
- 审稿人吐槽 EMNLP:四篇投稿三篇是 AI 垃圾还有人推荐接收 — artetxem · 2026-09-09