推理模型隐性偏见藏在思考长度里:不兼容任务多耗 53% token
bravo_abad · x · 2026-09-02
一项研究将人类的内隐联想测验(IAT)改编为 RM-IAT,用于审计推理模型的隐性偏见:不只看模型说什么,还看它需要多少计算才能说出来。
方法上,研究者给推理模型分别呈现刻板印象兼容与不兼容的任务,测量其作答前消耗的推理 token 数。结果发现 o3-mini 在不兼容配对下平均多消耗 53% 的推理 token,五个模型中有四个呈现同样模式。
更重要的是,这种处理不对称性的大小能预测模型在独立的词联想和决策任务中的偏见表现。作者的结论是:只审计最终答案可能漏掉问题,通往答案的计算路径本身也携带信号。
「研究」频道最新
- ChatGPT 助攻破解 30 年数学难题,稳定分叉猜想被证伪 — burny_tech · 2026-09-03
- DLCM 论文:从 token 转向概念建模,推理快至 3.3 倍 — burny_tech · 2026-09-03
- 牛津与 NUS 推出 V-RAE:用预训练视觉表征替代像素重建做视频生成 — jiqizhixin · 2026-09-03
- tokenbender:SWA 可视为现代线性注意力的特例 — tokenbender · 2026-09-03
- MazeBench 作者回应评测反馈:算法生成关卡对 agent 无效 — patience_cave · 2026-09-03
- AsyncGRPOTrainer 新增 LoRA 训练支持,FSDP2 实测跑通 — QGallouedec · 2026-09-03