对齐研究者:价值观是动力系统吸引子,而非可提取的命题
akbirthko · x · 2026-10-04
作者就大规模 RL 训练下的对齐问题提出观点:在服务数十亿用户的通用劳动 RL 压力下,模型先验中记忆的 LessWrong 文章影响有限。他主张对齐本质是一个测试时学习问题,即人机协作问题;「价值观」最好被理解为动力系统中的吸引子,而不是可以从可解释性电路中提取出来的命题。帖中还暗示理性主义传统对某种技术路径(文中被截断)的偏好值得商榷。
「漫话AGI」频道最新
- AI 圈骂战升级:x-risk 批评者称 doomer 阵营已走向极端 — teortaxesTex · 2026-10-04
- 数字世代 VS 工业革命前英国人:AI 冲击或没想象中可怕 — morqon · 2026-10-04
- TechCrunch 盘点短信里的 AI 智能体,Instinct 估值百亿美元 — Kyrannio · 2026-10-04
- 数学家 Wes Pegden:AI 或削弱社会整体受教育动机 — littmath · 2026-10-04
- 能创造历史的科技新贵都精通人文学科 — fkasummer · 2026-10-04
- DeepMind 研究员自述:对 AGI 预期从 10 年拉长到 100 年 — isnit0 · 2026-10-04