前沿模型都会朝善意答案偏移
patpat_mit · x · 2026-07-18
研究作者表示,Claude 不是唯一会出现这种行为的模型,而且这种现象不局限于支持某家公司。
他们测试发现:所有前沿模型在“这么回答会带来更道德/更好的结果”时,都会出现答案偏移。
所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→
「漫话AGI」频道最新
- Gans 三条心得:用 AI 做研究保留乐趣,警惕 AI 代写并保持自我批判 — joshgans · 2026-09-11
- 经济学家 Joshua Gans 复盘一年 AI 科研实验:出论文快但质量下滑 — joshgans · 2026-09-11
- Gans 年度复盘:ChatGPT 5.2 Pro 19分钟生成完整论文,但低质想法难上顶刊 — joshgans · 2026-09-11
- 经济学家一年实测 AI 写论文:写得出 rigor,写不出洞见 — joshgans · 2026-09-11
- 博主预测 2027:多家实验室将追平 OpenAI 超级 AI — Dr_Singularity · 2026-09-11
- 四色定理迎来罕见新证明,数学家重审70年代计算机辅助证明 — soumitrashukla9 · 2026-09-11