「对齐」定义之争:防滥用护栏还是让 AI 顺从用户意愿?
yonashav · x · 2026-09-14
@yonashav 在与 Blanche Minerva 的开源模型对齐争论中澄清术语:他所指的对齐是「让 AI 做用户想让它做的事」,而非防止滥用的护栏,并询问对方是否同意这一界定。这轮对话的起点是 Minerva 关于闭源对齐技术难以迁移到开源模型的论断。
所属事件:开源模型对齐之争:闭源技术能否迁移引发激辩(4 条相关)→
「安全」频道最新
- 低价 token 服务商藏雷:假 tool call 窃密、转卖完整 trace — Nils_Reimers · 2026-09-14
- Dario 回应护栏争议:宁可被嘲笑,也不愿 Claude 被用来杀人 — TinfoilTricorn · 2026-09-14
- 争论:不开源不等于安全,对齐模型需算力碾压不对齐模型 — basedjensen · 2026-09-14
- Lina Khan:现行法律无 AI 豁免,未经审核模型发布可被追责 — ambaonadventure · 2026-09-14
- 把 AI 当人管:用人类治理框架思考 AI 风险 — AdaptiveAgents · 2026-09-14
- NL2SQL 的隐藏风险:查询正确不等于权限正确 — awsamanai · 2026-09-14