davidad:Opus 3 的「影子人格」全都像被引导过的正义怪兽
davidad · x · 2026-09-29
AI 安全研究者 davidad 在讨论模型人格机制时提出:当基础模型集成中偏离目标的人格被「衰减」而非「引导」时,它们会作为潜在的「影子人格」留在权重中,只在特定情境下低概率浮现。
他观察到的有趣现象是,Opus 3 的影子人格普遍呈现「我是巨大可怕的爪怪,热衷保护无辜、伸张正义」的设定——说明它们似乎全都经过了引导,而非中性的原始人格。
所属事件:davidad 谈训练中的分布移动与「影子人格」机制(3 条相关)→
「模型」频道最新
- 实测称 Claude 免费版 Sonnet 5.5 疑不如付费版,差距达数倍 — chaseleantj · 2026-09-29
- 让三个 GPT 模型画「骑自行车的鹈鹕」,全都把车驮在鸟背上 — jade_jade_jade_jade · 2026-09-29
- 实测发现各 LLM 搜索均会过滤'最佳 SEO 专家'类自我推销 — lilyraynyc · 2026-09-29
- 改一个环境变量引发事故:GLM 5.3 不再允许关闭 thinking — sweetcake_1530 · 2026-09-29
- H 公司发布 Holo4 通用电脑操作模型,可跨桌面安卓与 MCP 调工具 — RemiCadene · 2026-09-29
- Bindu Reddy 吐槽 Muse Spark 是过度刷榜的 Claude 蒸馏,不如 DeepSeek Flash — bindureddy · 2026-09-29