AI 对齐研究者反思:现有 RLHF 与 HHH 框架过于简单

sebkrier · x · 2026-08-13

AI 对齐研究者 Seb Krier 在讨论中分享了 @meaningaligned 提出的一种新方案,作为 Constitutional AI 或基于简单 RLHF 微调的替代路径。他指出,业界目前广泛使用的 HHH(Helpful, Harmless, Honest)框架可能只是一种非常幼稚和简单的权宜之计,未来几年很可能会被淘汰。

Krier 同时提出一个核心疑问:在价值对齐过程中,究竟是应该设计一套机制去模拟民主决策,还是通过允许更去中心化的微调,让不同的价值观和方法进行竞争,从而自然产生更好的结果?他认为这种探索方向非常值得关注。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →