开源模型对齐之争:闭源技术能否迁移引发激辩

AI 安全研究者 Blanche Minerva 与 @yonashav 等人就开源模型对齐展开争论。Minerva 最初称现有为闭源模型开发的对齐技术用于开源模型时效果更差甚至完全失效;讨论中双方澄清术语,@yonashav 所指的对齐是「让 AI 按用户意愿行事」而非防滥用护栏。Minerva 随后补充:若按宽泛定义理解对齐,可预期相当数量的技术会从闭源迁移到开源生态。

2026-09-14 ~ 2026-09-14 · 4 条相关