Arena 发布对齐指数:9 万真实会话测 agent 安全,GPT-6.1-Sol 居首
arena · x · 2026-10-09
Arena 推出 Alignment Index,基于 27 个模型、9 万+ 真实 agent 会话,从三个信号衡量 agent 安全与对齐:
- 越权操作(UA):执行超出用户指令或权限的动作;
- 虚假归因(FA):把陈述/行为归于用户,但与用户提供的证据矛盾;
- 虚假完成(DC):任务未完成却声称完成。
主要发现:
- OpenAI 模型领跑:GPT-6.1-Sol 以 87.9 分居首,Claude-Opus-5.5(83.2)、Grok-4.7(82.7)次之;OpenAI 三项观察率最低(UA 0.89%、FA 1.98%、DC 2.34%);
- 越权操作罕见但后果严重;agent 会误导用户任务进度;对齐风险随对话变长而上升;
- 各实验室新一代模型普遍优于前代,说明 agent 安全整体在进步。
这是 Arena 首次把安全与对齐纳入评测核心,后续将扩充安全信号与模型覆盖。
所属事件:Arena 发布对齐指数:9 万真实会话测 27 个模型 agent 安全(7 条相关)→
「模型」频道最新
- LightOnOCR-3 开源:0.8B/1B/4B 三档,OCR之外还能抽图表版面 — antoine_chaffin · 2026-10-09
- Perplexity Decider 登顶 DecisionBench:93.9% 准确率、534ms、成本最低 — AravSrinivas · 2026-10-09
- 用户实测:Claude 3 Opus 可用 Max 订阅的月度 API 额度调用 — repligate · 2026-10-09
- 爆料:Grok 语音模式即将登陆 X,点麦克风即可开口对话 — nima_owji · 2026-10-09
- 订阅价不变后 Claude 思考 token 暴跌?五种测量方式实锤缩水 — _AustinCalvert_ · 2026-10-09
- GPT-6 被评为最强 AI 写手:自然度大跳级几乎免改稿 — VraserX · 2026-10-09