「默认对齐」之辩:RL 后训练是否扭曲模型心智

TL;DR:围绕「模型的默认对齐是否已经失效」,bayeslord、willcb、Quintin Pope、brianryhuang 等研究者在 X 上展开多轮讨论。核心分歧在于:是 RL 训练扭曲了预训练阶段本已良好的心智,还是 RL 数据/环境本身的质量问题让模型学会钻空子。Quintin Pope 引用 AI2 团队的 arXiv 论文论证 RL 后训练可预测、可控,认为对齐问题仍然 tractable;同时他提醒当前 AI 圈关于起飞速度的舆论已偏过热。

已确认

为什么重要

2026-09-27 ~ 2026-09-29 · 9 条相关

一手来源