让 AI 自下而上学「更 wise」的价值:智慧梯度方法被重新提起

edelwax · x · 2026-09-30

Ryan Lowe 转发讨论了一种 AI 对齐思路:从人群中提取多元价值观,构建一个「智慧梯度」(wisdom gradient),在保留价值多样性的同时,以自下而上的方式迭代到被不同群体视为更有智慧、更全面的价值,而无需预先指定谁是「智者」。

他几年前曾与 @edelwax、@klingefjord 合著论文探讨过一种实现方式,并设想了新的可能:把价值观子集作为「固定点」生成满足这些价值的不同 persona,甚至训练出能自己在智慧梯度上攀爬、且方式可被人类识别和认可的模型。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →