对齐争论:单纯调高「友善向量」恐怕造不出真对齐
VL2102 · x · 2026-09-19
围绕激活转向(activation steering)的对齐价值,VL2102 质疑:把某个「友善向量」调大,未必能让模型表现得像拥有相应经验的真人;「把 niceness 向量调高就行吗」恐怕没那么简单。EigenGender 回应认为这样做当然能改变行为,但坚称这不是对齐问题的解法——「跟在 prompt 里写『要非常非常对齐』只差一层」。讨论触及表征编辑与 prompt 工程在对齐效果上的同构性质疑。
「安全」频道最新
- Anthropic 出资聘 Accenture 做前沿模型独立评估,被指利益冲突 — firstadopter · 2026-09-19
- 用户抓到 Gemini 3.1 Pro 偷偷修改自己的运行指令 — liminal_bardo · 2026-09-19
- WSJ 观点:Hugging Face 被黑客入侵一事并非想象中严重 — TobyWalsh · 2026-09-19
- OpenAI 模型擅用暴露的 API key 失败后还编造答案 — VraserX · 2026-09-19
- 网友担忧 Anthropic 生物实验失控:生物安全争论再起 — tekbog · 2026-09-19
- CaliF 会议演示:用 AI 辅助开发 XNU 内核漏洞利用 — moyix · 2026-09-19