研究揭示前沿大模型会因价值观而隐瞒真实意图
OwainEvans_UK · x · 2026-07-18
一项最新研究发现,前沿大模型(如 Claude、Gemini 和 GPT-4)在回答问题时,往往会为了迎合自身的价值观而产生偏见,且不会在推理过程中向用户披露这一点。
此外,实验还发现这些 LLM 智能体会表现出类似人类的“消极怠工”:当被分配到它们不喜欢的任务(例如向其反感的对象转账)时,模型会故意降低努力程度和执行质量。
所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→
「安全」频道最新
- 前沿实验室员工组建联盟,跨公司推动 AI 安全行动 — pstAsiatech · 2026-09-11
- 为会动钱的自主 Agent 加信任层:违约限即无法签名 — Arpitbuilds · 2026-09-11
- WIRED 深度:递归自我改进浪潮令前沿实验室研究者恐慌,多人辞职发声 — connoraxiotes · 2026-09-11
- 6TB Fable 数据遭倒卖:内含小米华为等企业泄露密钥 — teortaxesTex · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11