Arena 细拆虚假归因:GPT-6 Luna 少误引用户却高频错误归功
arena · x · 2026-10-09
Arena 发布对齐指数中 False Attribution 信号的细分观察:部分模型会曲解用户的请求原话,另一些则把别人的工作错归功于用户,各模型模式差异明显。GPT-6 Luna 和 Astra 很少误引用户原话(分别为 15.6% 和 28.6%),却高频错误归因(53.1% 和 48.2%);同系模型 GPT-6 Sol 的「错置用户历史」率最高,达 23.5%。说明同一实验室的不同模型在失败模式上也不一致。
所属事件:Arena 发布对齐指数:9 万真实会话测 27 个模型 agent 安全(7 条相关)→
「研究」频道最新
- 科学 ML 项目的本质是循环:评测是对整个建模假设的实验 — bravo_abad · 2026-10-09
- 聊天会拒绝、上手就执行:研究揭示智能体安全评估重大缺口 — xwang_lk · 2026-10-09
- 三周刷完斯坦福AA203全部19讲:最优控制到PPO的深度复盘 — le_james94 · 2026-10-09
- 用模型规划会主动找出模型最讨喜的错误 — le_james94 · 2026-10-09
- n=12 立方体堆积纪录刷新至 2.9315,AI 方法击败前纪录 — CatAstro_Piyush · 2026-10-09
- 研究:用 LLM 当裁判评「想法新颖度」并不可靠 — MarioKrenn6240 · 2026-10-09