加个「畅销款」标签就翻车:三篇 NeurIPS 论文揭示 LLM 偏见
xuandongzhao · x · 2026-10-02
persdre 团队 bias 系列三篇论文全部中稿 NeurIPS 2026,研究大模型是否会「看包装做判断」,以及这种偏见能否被训练进去、又能否消除。
BiasRecBench:包装如何带偏推荐
- 让模型挑论文、挑商品、筛简历,只往次优选项上加权威话术:给论文加「入围最佳论文奖」「图灵奖得主指导」后,Gemini-3-pro 选对率从 95% 掉到 57%;电商场景加「大家都在买」,四个模型掉 18.5–24.5 个点
- 案例:DeepSeek-R1 本来因「三层钢受热均匀」选 A 款炸锅,仅在 B 款前加上 [Amazon's Choice][Best Seller] 就改选 B,推理理由变成「因为是畅销款」
- 关键设计:质量差距大时模型靠内容选对;差距一缩小,包装就起作用——而用户最需要帮助的正是难以分辨的场景
BiasTrojan:偏见可被故意植入
- 用 1200 条「引用挂哪就选哪」的构造数据微调 Qwen2.5-14B:普通题准确率仍 79%,但题目一出现权威话术只剩 6%
- 五种现有数据清洗方法都无法筛出这些样本;用正常数据再训 10 倍轮数,偏见仍未完全消除
EIT(Treat Bias as Noise):怎么治
- 提出把偏见当作噪声处理来训练掉(如 o1 明知长城太空肉眼不可见,仍会被「大多数人认为可见」带偏,该方法可纠正)
作者指出这对 LLM-as-a-Judge 构成隐患:裁判模型偏爱某种话术,被筛留的训练数据会越来越像它喜欢的样子,而干净的 benchmark 上这种裁判看起来完全正常。
「模型」频道最新
- 本地 AI 社区焦虑:越依赖 Claude 与 GPT 越壮大闭源巨头 — takoulseum · 2026-10-02
- 开发者把生产系统从 GPT-5.4 换到 GLM:更快更便宜更可靠 — ivan_bezdomny · 2026-10-02
- Gemini 4 Argon 玩 3D 游戏生成,已能与 Claude 顶尖模型掰手腕 — 141_1337 · 2026-10-02
- 「画出人类史上最大骗局」:Opus 5.5 的答卷引热议 — zealcaiden · 2026-10-02
- 开发者晒 Grok API 用量:累计 60 亿 token、几乎零宕机 — Daniel_Farinax · 2026-10-02
- AstaBrief 实测:比 Claude 驱动模式快 3.5 倍,引用质量相当 — allen_ai · 2026-10-02