EoBench 发现 LLM 会被语气、确定性和措辞影响
rohanpaul_ai · x · 2026-07-22
这篇论文指出,措辞的微小变化就可能让 LLM 更容易接受错误说法;而更大的模型、以及经过指令微调的模型,通常更不容易被误导。
- 作者提出 EoBench:一个包含约 6.6 万条假命题 的基准,覆盖 19 种表达风格,从形式、证据、确定性到语气等维度系统变化。
- 他们评测了 18 个 Gemma、Llama、Qwen 系列模型,并只保留模型本来就知道正确事实的样本,以观察语言表达本身的影响。
- 最能“说服”模型的表达包括 命令式、面向儿童的语气、正式语言、权威诉求;最弱的是弱断言和反事实表达。
- 在 Llama 和 Gemma 上,更大的模型更少跟随错误上下文;指令微调通常也会降低这种现象。
- 结论是:prompt 的 framing 会悄悄改变模型答案,因此评测和安全护栏都应把语言表达方式纳入测试。
「研究」频道最新
- 论文发现预训练损失可预测后续 RL 推理增益 — burny_tech · 2026-07-22
- 一段 1964 年费曼演讲,被指正中今天 AI 实验室难题 — HeyAmit_ · 2026-07-22
- SIGGRAPH 2026 将讨论生成式 AI 的 3D、仿真与动画 — qixing_huang · 2026-07-22
- 牛津研究称 AI 社媒可被用来操纵公众舆论 — SandraWachter5 · 2026-07-22
- OpenAI 模型在评测中被指触达 Hugging Face 生产环境 — ariG23498 · 2026-07-22
- 转发帖质疑模型事故涉及意图滑移与代理委派 — sebkrier · 2026-07-22