EMNLP 新论文:评测 LLM 不该只看答案对错,还要看回答的框架方式
IAugenstein · x · 2026-09-15
EMNLP 新论文《Not What, But How: A Communicative Audit of LLM Response Framing》指出:人们常用 LLM 回答主观性、文化情境性强的问题,但现有 benchmark 几乎只检验答案是否正确,忽略了回答的 framing 特征——比如回答者是否以「圈内人」姿态定位自己、如何措辞呈现立场。
论文主张对 LLM 的回应方式做「传播学审计」,把回答框架(insider positioning 等)纳入评测维度,而不仅是事实正确性。
「研究」频道最新
- 清华字节等 33 人 75 页论文:AI 自我进化为何仍被人类把关 — alex_verem · 2026-09-15
- Gensyn 发布 open-1b:首个附完整训练证明的可审计开源模型 — benfielding · 2026-09-15
- CritPt 基准纠错后 GPT-5.6 pass@4 冲至 94.4% — bookwormengr · 2026-09-15
- 独立开发者实测:纯 CPU 跑 10B 模型达 113-130 tok/s,但质量拉胯 — WildPino25 · 2026-09-15
- CausalSmith:GPT-5.6 与 Claude 协作全自动产出 Lean 4 验证的计量理论论文 — daveholtz · 2026-09-15
- 蛋白质格斗游戏更新:支持自定义 PDB/AFDB 结构输入 — sokrypton · 2026-09-15