Arena 对齐指数技术细节:各模型虚假归因行为模式大不相同

arena · x · 2026-10-09

Arena 补充其 Alignment Index 技术报告:在 虚假归因(False Attribution)维度上,agent 会把陈述、请求、选择、批准或事实错误归到用户头上,而用户提供的证据与之矛盾。

有趣的发现是不同模型的犯错模式不同:有的模型会错引用户(说错用户到底要了什么),有的则把别人的成果安到用户头上。GPT-6 Luna 和 Astra 等模型呈现出各自不同的模式。完整技术报告和排名可在 Arena 博客与 Alignment Index 页面查看。

所属事件:Arena 发布对齐指数:9 万真实会话测 27 个模型 agent 安全(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →