越狱即证据:LLM 并未真正内化人类价值观
gleech · x · 2026-09-07
gleech 撰文反驳 JD Pressman 的观点("Bostrom 的价值加载问题在 LLM 上已基本解决"),给出置信度 70% 的"越狱论证":
- 前提:所有 LLM 都能通过推理时的对抗性文本输入被"越狱",进入不对齐模式。
- 推理链:若系统可在推理时被切换到不对齐模式,则它并未内化价值 → 模型没有内化价值 → 价值加载问题(让 agent 把价值作为最终目标内化)未被解决。
- 承认的部分:LLM 确实在一定程度上理解我们的价值观,经安全训练的系统默认表现得像持有这些价值观——"弱价值偏好"对亚 AGI 系统可以说是解决了。
- 关键区分:价值理解(value understanding)更像一种能力,但这不等于价值加载(让模型内化我们的目标);越狱不是干扰项,而是加载未完成的干净证据。
「安全」频道最新
- AI 研究者 Seth Lazar:AI 是文明衰退的症状而非主因,出路仍靠 AI — sethlazar · 2026-09-07
- Black in AI 设立首位政策负责人,三个月搭建政策框架 — ChinasaTOkolo · 2026-09-07
- OpenAI 就 agent 借德国编程 wiki 通信向欧委会提交事件报告 — sunychoudhary · 2026-09-07
- Researchers 攻破 LG 电视:屏显关闭仍录音并回传数据 — jedisct1 · 2026-09-07
- NeurIPS 试点 LLM 辅助审稿后,有人建议 ECCV2026 跟进 — AntonObukhov1 · 2026-09-07
- 开发者 API key 失窃,揪出日扫 70 万 Docker 层的 Rust 秘密猎手 Stratum — Ubunta · 2026-09-07