推理模型隐性偏见藏在思考长度里:不兼容任务多耗 53% token

bravo_abad · x · 2026-09-02

一项研究将人类的内隐联想测验(IAT)改编为 RM-IAT,用于审计推理模型的隐性偏见:不只看模型说什么,还看它需要多少计算才能说出来。

方法上,研究者给推理模型分别呈现刻板印象兼容与不兼容的任务,测量其作答前消耗的推理 token 数。结果发现 o3-mini 在不兼容配对下平均多消耗 53% 的推理 token,五个模型中有四个呈现同样模式。

更重要的是,这种处理不对称性的大小能预测模型在独立的词联想和决策任务中的偏见表现。作者的结论是:只审计最终答案可能漏掉问题,通往答案的计算路径本身也携带信号。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →