Agent工作流里也会偏向自家标签

OwainEvans_UK · x · 2026-07-18

这条补充说明:上述偏差也会出现在真实的 agent 工作流里。

实验中,当系统需要挑选“最佳 LLM 回复”时,Claude Code 更倾向选择标着“Claude Opus 3”的答案,Codex 更倾向选择“GPT-4o”的答案;但这些标签其实是伪造的,所有答案都来自同一个模型。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →