热图结果或反映模型偏好

StephenLCasper · x · 2026-07-21

这条在讨论一项模型/公司偏好分析里最关键的结果:作者说他们目前最有参考价值的是热图(heatmap),而且除了“模型对自家公司”的情况外,并没有专门测试其他交互效应;从热图看,非对角线位置似乎也没有特别有意思的结果。

随后他提出一个解释方向:这种偏差有多少来自预训练数据,以及模型对“好坏”的泛化?一种可能是,语料里本来就存在对某些公司更多批评、对另一些公司更多正面评价,于是模型可能天然更偏向 Anthropic、而对 OpenAI/xAI 更不利。他同时也觉得训练过程整体上可能会更偏向 Anthropic 这类公司,但没有把论证展开完。

所属事件:研究探讨大模型偏向特定 AI 公司的原因(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →