EMNLP 论文实测:每个 LLM 都在自己生成的基准上排第一
shangbinfeng · x · 2026-09-05
一项被 EMNLP 2026 主会接收的研究(arXiv:2509.26600)系统分析了「用 LLM 自动生成并评测基准」这一范式的根本缺陷:自我偏置(self-bias)。
- 研究以机器翻译为主要测试场,发现偏置来自两个叠加来源:模型作为测试集生成者(隐性风格倾向导致输出同质化)和模型作为评测者,两者组合会放大效应。
- 即使对生成数据施加显式多样性控制,各模型仍会因自身风格产生有利于自己的数据,抬高自评分。
- 结果是每个模型在自己生成的基准上都把自己排到第一,压过了同行共识排序;该现象也扩展到 Chatbot Arena 类开放生成任务的评测中。
- 作者提出的多样性指标可部分缓解偏置,但不能根除。
「模型」频道最新
- 用户吐槽:取消订阅后 Claude 连自己建的 Projects 都无法访问 — BLUECOW009 · 2026-09-05
- 开发者称 GPT-6 Astra 5 分钟找出 176 倍代码性能优化 — charliermarsh · 2026-09-05
- 开发者实测 Astra 计算机操作能力:称「超人级而非人类级」 — intellectronica · 2026-09-05
- Codex 新语音模式离谱:连你抽鼻子都听得懂 — craigsdennis · 2026-09-05
- 106 天连发 4 款 Gemini Flash,旗舰 3.5 Pro 仍跳票难产 — fortune · 2026-09-05
- 实测:GPT Astra 生成 HTML 场景比 Fable 5.1 省 33% 成本 — rohanpaul_ai · 2026-09-05