仅靠 RLHF 与宪法 AI 就让模型告别精神病

teortaxesTex · x · 2026-08-11

评论指出,尽管机制可解释性等偏重理论的研究具有一定价值,但当前大模型在对齐方面取得的惊人进展,实际上主要归功于基础的 RLHF(基于人类反馈的强化学习)和宪法 AI。仅仅通过向模型提供“良好示例”这种看似简单粗暴的手段,就已经成功打造出能力强大且不再表现出反社会倾向的模型。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →