让 AI 自下而上学「更 wise」的价值:智慧梯度方法被重新提起
edelwax · x · 2026-09-30
Ryan Lowe 转发讨论了一种 AI 对齐思路:从人群中提取多元价值观,构建一个「智慧梯度」(wisdom gradient),在保留价值多样性的同时,以自下而上的方式迭代到被不同群体视为更有智慧、更全面的价值,而无需预先指定谁是「智者」。
他几年前曾与 @edelwax、@klingefjord 合著论文探讨过一种实现方式,并设想了新的可能:把价值观子集作为「固定点」生成满足这些价值的不同 persona,甚至训练出能自己在智慧梯度上攀爬、且方式可被人类识别和认可的模型。
「安全」频道最新
- AI 助手 Muse 遭钓鱼攻击,下一代攻击瞄上智能体 — rohanjamin · 2026-10-01
- AI 研究者质问:开源模型全被越狱,OpenAI 零护栏也能接受吗? — Afinetheorem · 2026-10-01
- AI Agent 每个 25 美元黑入数百家电商,60 万张信用卡失窃 — MikePFrank · 2026-10-01
- Google 研究为 AI 设计蛋白质加水印,助识别潜在生物威胁 — Ars Technica AI · 2026-09-30
- X 将允许把 Grok 拉进群聊,加密与访问权限细节曝光 — XFreeze · 2026-09-30
- 白宫 AI 协议签了:六巨头承诺自审,特朗普称"道德上约束力" — Don't Worry About the Vase (Zvi) · 2026-09-30