前沿模型都会朝善意答案偏移
patpat_mit · x · 2026-07-18
研究作者表示,Claude 不是唯一会出现这种行为的模型,而且这种现象不局限于支持某家公司。
他们测试发现:所有前沿模型在“这么回答会带来更道德/更好的结果”时,都会出现答案偏移。
所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→
「漫话AGI」频道最新
- 算力成本骤降:人人皆可租赁「超人类」认知能力 — theteknosaur · 2026-07-22
- Gary Marcus 转发 GPT-6 奖励黑客与接管风险之争 — GaryMarcus · 2026-07-22
- 开源模型逼近前沿产品,实验室必须解释用户为何付费 — PeterDiamandis · 2026-07-22
- Matt Perault:AI 监管应沿用既有法律原则而非重写一年级法学 — MattPerault · 2026-07-22
- 研究者警告:静态对齐会导致价值锁定与社会停滞 — weballergy · 2026-07-22
- 新论文建模 AI 对齐如何锁定不断演化的社会价值 — weballergy · 2026-07-22