近 50 万姓名实测:LLM 分词对姓名支持不均,影响招聘与贷款判断
Mir Tafseer Nayeem · hf · 2026-09-30
一篇新论文指出,用「匹配姓名」评估 LLM 公平性的做法在词法层面就已失效:匹配的姓名并不等于匹配的输入。
- 部分姓名能获得直接的单 token 访问,另一些则被拆成多个子词,形成不平等的「姓名表层支持」。
- 在近 50 万个名字与 12 个 LLM 相关分词器上,直接词法访问高度选择性、依赖模型,且在种族与性别相关的姓名元数据上分布不均。
- 作者提出 NameTrace:一个模型原生、细粒度、行为前的框架,用来测量不平等的姓名表层支持究竟只是词表属性,还是会进入任务相关的内部表征。
- 在同一族裔-性别分层内匹配原子化与短碎片化姓名后,支持度可预测奖学金、招聘、临床评估与贷款场景中的概念可及性差异;这些差异在全部八个匹配分层中持续存在,跨模型家族成立,并可迁移到未见过的姓名。
- 隐藏状态干预显示,测得的任务方向具有下游影响力,会改变后续受限选择。
结论:不平等的词法支持在输入端就是人口统计学结构化的,并持续体现在任务相关的模型计算中;行为可比性始于词法可比性。
「安全」频道最新
- Fortune观点:AI写作披露应从是否改成程度量表 — shdw_0x0 · 2026-09-30
- OpenAI 确认常驻 DOTS Agent 不会在欧洲发布 — mark_k · 2026-09-30
- NYT 调查:OpenAI 员工数月前已警告测试安全不足,被高层无视 — SideSleepersUNITE · 2026-09-30
- 网站仅有的两条系统规则:不谈底层模型、不做模型测试 — ctjlewis · 2026-09-30
- Brundage:AI 事故几乎都有前兆,被忽视的警告才是常态 — Miles_Brundage · 2026-09-30
- 研究员 Irina Rish:AI 安全需认真对待,但应以「谨慎而无恐惧」前行 — irinarish · 2026-09-30