MBZUAI 发布价值冲突数据集,用任务向量给 LLM 装上价值观开关
MBZUAI · hf · 2026-09-21
MBZUAI 团队发布针对 LLM 道德价值对齐的研究,核心内容:
- 数据集:1.2 万条两难困境实例,覆盖诚实 vs 公正、公正 vs 自主、自主 vs 诚实三组价值冲突,并翻译成印地语、阿拉伯语、西班牙语、中文以测试跨语言表现。
- 发现:GPT-5-mini 在无政策提示时,五种语言下都稳定偏好「诚实」胜过「自主」;Llama-3.2-1/3B 则有强烈的第一选项偏置。
- 修复:普通微调和 DPO 都能消除首选项偏置,准确率提升到 98% 以上。
- 核心方法:计算特定价值偏好的 task vector 后,与通用指令遵循向量正交化,从而剥离数据相关性、分离出抽象价值方向;该向量可用于 task arithmetic,让模型反转立场。
这项工作提供了一种可组合、可解释的价值对齐手段。
「研究」频道最新
- AI for Science 周报:跨领域重复模式与可迁移的科研方法论 — bravo_abad · 2026-09-21
- Komlós 猜想再添更简证明,Karingula 与 Lovett 新版 arXiv 上线 — stevenstrogatz · 2026-09-21
- Komlós 猜想被宣布解决,数学家点出其对神经网络量化的隐含意义 — stevenstrogatz · 2026-09-21
- CIC+LEM 竟可证明 Con(ZF),Mario Carneiro 用 AI 工具获突破 — leloykun · 2026-09-21
- Qwen 团队发布 OmniVChat:原生音视频对话的数据引擎与基准 — Qwen · 2026-09-21
- 小米 MiMo-V2.6 强化学习实录:checkpoint 里到底存了什么 — tokenbender · 2026-09-21