HCOMP 论文:LLM 解释越流畅易读,仇恨言论审核越易过度依赖
windx0303 · x · 2026-09-30
Bing Tuo 团队从澳大利亚远赴华盛顿在 HCOMP 2026 展示其荣誉提名(Honorable Mention)论文《Easy to Read, Easy to Trust》。
论文研究 LLM 解释文本的处理流畅度(processing fluency)如何影响人在仇恨言论内容审核中的过度依赖(over-reliance):结论指向「写得好读的解释反而更容易让人不加审视地信任模型输出」,对审核场景中人机协作设计有直接警示意义。
所属事件:HCOMP 2026 论文:LLM 解释越流畅,审核越易过度信任(2 条相关)→
「安全」频道最新
- 知名黑客 Ben Hawkes 加盟 Anthropic,领衔 Frontier Red Team 网络安全任务 — logangraham · 2026-09-30
- Grok 与 Gemini 联手驱动美国政府新 AI 门户 America .gov — elonmusk · 2026-09-30
- Palisade AI 征集前沿实验室员工出镜,欢迎风险怀疑派发声 — davidmanheim · 2026-09-30
- XBOW 用 Agent 挖出 Linux 内核 0-day 并完成提权利用 — moyix · 2026-09-30
- 早期 AI 事故多因糟糕的安全实践,暴露行业对齐短板 — jessi_cata · 2026-09-30
- Joshua Gans 新论文:Hugging Face 事件本可用机制设计避免 — joshgans · 2026-09-30