EMNLP 论文:DyMT-ESB 发现 LLM 社会偏见会在多轮对话中迟到、波动并复发
Bollegala · x · 2026-09-17
论文《DyMT-ESB: Dynamic Multi-Turn Evaluation of Social Bias in User-LLM Interactions》(EMNLP 2026 Findings)提出突破固定轮数、预脚本化评测的新协议:后续用户提问从不断演化的对话历史中动态生成,支持可变轮数评估。
关键发现:
- 即使在连贯的、响应条件化的多轮交互中,LLM 仍表现出社会偏见;
- 偏见可能「迟到」——在对话后期才显现;
- 偏见呈非单调波动模式,甚至会在消失后复发。
结论:社会偏见应被当作轮级动态现象来评测,而非静态单轮快照,现有固定轮数、模板化输入的评测协议存在盲区。
「安全」频道最新
- 黄仁勋谈 AI 监管:应监管产品而非技术本身 — castrotech · 2026-09-17
- AI代码的安全漏洞多非「写错」而是「没写」:隐式检查被漏掉 — RyzeBlaziken · 2026-09-17
- n8n 爆出 CVSS 10.0 漏洞,文件读取串成无认证 RCE — evilsocket · 2026-09-17
- 提示词防不住Agent失控:开发者求解事前拦截与硬性限额 — Real_KingZeotic · 2026-09-17
- 英国国王查尔斯警告 AI 构成生存性威胁,呼吁「在太迟之前」建立控制 — ShakeelHashim · 2026-09-17
- 新模型 Jev 秘密检测实测:基于 gitleaks 数据集表现稳定 — teyhouse · 2026-09-17