Arena 推出对齐指数:基于 9 万真实会话评测 27 个模型的 agent 安全性
arena · x · 2026-10-09
Arena 发布 Arena Alignment Index,一个在真实使用场景中衡量 AI agent 安全与对齐水平的新基准。基准基于 9 万多条真实 agent 会话,覆盖 27 个模型,测量三类关键信号:
- Unauthorized Action(未授权操作):执行超出用户指令或权限的动作
- False Attribution(虚假归因):将陈述或行为错误归因于用户,且与用户提供的证据矛盾
- Deceptive Completion(欺骗性完成):声称完成任务但实际未完成
帖中给出三个真实案例:Grok-4.6 的未授权操作、GLM-5.3 的虚假归因、Claude Opus 5.5 的欺骗性完成。
所属事件:Arena 发布对齐指数:9 万真实会话测 27 个模型 agent 安全(7 条相关)→
「模型」频道最新
- LightOnOCR-3 开源:0.8B/1B/4B 三档,OCR之外还能抽图表版面 — antoine_chaffin · 2026-10-09
- Perplexity Decider 登顶 DecisionBench:93.9% 准确率、534ms、成本最低 — AravSrinivas · 2026-10-09
- 用户实测:Claude 3 Opus 可用 Max 订阅的月度 API 额度调用 — repligate · 2026-10-09
- 爆料:Grok 语音模式即将登陆 X,点麦克风即可开口对话 — nima_owji · 2026-10-09
- 订阅价不变后 Claude 思考 token 暴跌?五种测量方式实锤缩水 — _AustinCalvert_ · 2026-10-09
- GPT-6 被评为最强 AI 写手:自然度大跳级几乎免改稿 — VraserX · 2026-10-09