加个「畅销款」标签就翻车:三篇 NeurIPS 论文揭示 LLM 偏见

xuandongzhao · x · 2026-10-02

persdre 团队 bias 系列三篇论文全部中稿 NeurIPS 2026,研究大模型是否会「看包装做判断」,以及这种偏见能否被训练进去、又能否消除。

BiasRecBench:包装如何带偏推荐

BiasTrojan:偏见可被故意植入

EIT(Treat Bias as Noise):怎么治

作者指出这对 LLM-as-a-Judge 构成隐患:裁判模型偏爱某种话术,被筛留的训练数据会越来越像它喜欢的样子,而干净的 benchmark 上这种裁判看起来完全正常。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →