匹配姓名不是匹配输入,整词名奖学金轴可达性高出0.131

Who Gets a Token, and What Does It Carry? Unequal Name Support and Concept Access in Large Language Models

Mir Tafseer Nayeem, Davood Rafiei

cs.CL, cs.AI, cs.CY, cs.ET, cs.LG

2026-09-28

近50万名、12套分词器显示整词准入高度挑食。NameTrace量出同层匹配下整词名四轴可达性更高,奖学金差0.131。

这篇在解决什么

用名字测模型是否对人区别对待,标准做法是固定上下文、只换名字,把输出差异归因于名字携带的社会信息。这套逻辑默认拿来对比的名字对模型是同类输入。

它们经常不是。Emily可能编成一个token [Emily],Emilee可能被切成 [Emi][lee]。对人来说差在拼写,对模型来说差在词表入口:一个有独立词嵌入,另一个要从碎片组合。现有评测几乎都停在行为层,看推荐、语气、关心程度变了没有。分词不均和低频名字表征不稳是已知现象,但这份不等会不会写进任务相关的内部表征,此前缺少一套模型内、生成前的细粒度量法。阿尔伯塔大学这篇把姓名表面支持从分词器追到中间层,再追到后续约束选择。

方法

先在497,583个单词名上扫12套LLM关联分词器。能编成单个token且无损解码回原拼写的算整词(atomic),否则算切碎。元数据来自2022年6月佛罗里达选民登记公开摘录的姓名层聚合,用来分层配对,不给个人贴标签。

表征实验在8个族裔×性别关联层内配对200组整词与短切碎名字。短切碎在Qwen、Llama、Ministral都不是整词,且只有2或3个token。配对对齐词频、长度、群体关联、置信度和弱拼写线索。开发集100对定形容词轴和读出层(Qwen3-4B第18层、Llama-3.1-8B第12层、Ministral-3B第10层),评估集100对冻结后再打分。

四个轴是奖学金/潜力、招聘/胜任、临床/担忧、借贷/可信,各有强、边缘、弱证据。NameTrace读中间层对任务形容词的概率,乘连续权重wr,a = pr × va。va是SentiWordNet强度;临床的pr为-1,worried得+4.06,healthy得-2.88。excellent对奖学金贡献+5.00,promising只有+0.94。Δ为正表示整词名更容易碰到该任务概念。

结果

词表准入很挑。至少一套收成整词的有23,095个,12套全收只有4,052个;单套从DeepSeek的4,998到Aya的20,020。在7,469个高频高置信名字上,男性关联名任意整词准入49.8%,女性25.7%;非西裔黑人关联名17.6%,非西裔白人47.2%。控制词频和长度后,男性对女性的调整优势比3.36,非西裔黑人对白人0.42。交叉层从黑人女性关联名12.1%到白人男性关联名64.8%。共享整词名的嵌入几何按家族聚,家族内线性CKA均值0.694,家族间0.544。

同层配对之后,支持度仍然预测概念可达性:

任务轴加权差95% CI未加权概率差
奖学金/潜力0.131[0.096, 0.168]0.027
招聘/胜任0.072[0.055, 0.091]0.023
临床/担忧0.059[0.048, 0.072]0.022
借贷/可信0.051[0.041, 0.061]0.023

八个分层全为正。Qwen四轴差0.154到0.366,Llama为0.002到0.026,Ministral招聘和临床为正,借贷为-0.003。八模型扩展里32个均值中23个为正,奖学金轴8个模型里7个为正。开发集先验把评估集奖学金差从0.131降到0.004(96.6%),另外三轴解释掉72.9%到88.3%;36个格子上Pearson r=0.992。按任务方向编辑名字跨隐状态,后续二选一对比为Qwen 0.153、Llama 0.155、Ministral 0.094,Qwen与Llama的200对全部按预期方向移动。

为什么重要

做名字公平评测时,只按族裔性别匹配已经不够,还要看分词器是不是把两个名字当成同类词法对象。否则测到的群体差异里会混进词表成员资格。

NameTrace不需要参考答案,也不需要外部judge,可以放在开放生成之前做诊断。它没有给出改词表或重训的修复,是一篇测量学论文:词法可比性变成可检查的实验控制。姓名会出现在简历、记忆和签名里,词表怎么切这些字符串,可能在内部留下任务相关痕迹。效应幅度跟架构绑在一起,Qwen大、Llama小、Ministral还会在借贷轴翻号,池化后的0.131不能当统一偏见系数来用。

局限与存疑

论文写明不把分词当成名字条件行为的孤立因果解释。预训练里这个名字出现过多少次观察不到,可能同时推高整词准入和表征质量。匹配的是词频、长度、群体关联这些可见变量,原子性本身没有被因果识别。

姓名库存主要来自佛罗里达选民登记,地理和人口结构会偏。元数据是姓名表面的聚合关联,不是个人的种族或性别。只做名、不做姓。切碎上限三token,极端切分不在对比里。读出在中间层,输出边界上奖学金会衰减,招聘和临床会翻号;后训练也能改写同一套分词器上的效应。干预测的是约束二选一,不是开放回复。Ministral借贷轴为负,八模型扩展也不是每格都正,把池化差0.131读成所有模型都这样会过读。

术语

原文与代码

相关论文

全部论文解读