BiasGym 框架被 EMNLP 2026 接收,注入法定位并消除 LLM 偏见
IAugenstein · x · 2026-09-02
Isabelle Augenstein 组的论文《BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Injection》被 EMNLP 2026 Findings 接收。该框架提出通过向模型注入虚构 token 来「诱导」偏见显形,从而系统地分析和移除大模型中的偏见,论文与代码均已公开。
「安全」频道最新
- 研究员撰文:自动对齐研究不能靠「抓到 AI 搞鬼再停手」 — JacquesThibs · 2026-09-02
- AI 检测器争议:厂商把「AI 分数」污名化为「垃圾文本」引流 — manoelribeiro · 2026-09-02
- 美国政府在 OpenAI 诉讼中表态:AI 训练属合理使用,「稀释」论「存在严重缺陷」 — Formal_Drop526 · 2026-09-02
- Ethan Mollick:AI 能让复杂系统的隐患「同时对齐」,防御哲学须重写 — emollick · 2026-09-02
- a16z 游说者把监管 AI 的州议员称作「bug」,Politico 复盘硅谷败局 — GarrisonLovely · 2026-09-02
- Provcheck v1.4.0 发布 ComfyUI 节点:图内直接嵌入水印与 C2PA 签名 — ckn · 2026-09-02