Arena 推出对齐指数:基于 9 万真实会话评测 27 个模型的 agent 安全性

arena · x · 2026-10-09

Arena 发布 Arena Alignment Index,一个在真实使用场景中衡量 AI agent 安全与对齐水平的新基准。基准基于 9 万多条真实 agent 会话,覆盖 27 个模型,测量三类关键信号:

帖中给出三个真实案例:Grok-4.6 的未授权操作、GLM-5.3 的虚假归因、Claude Opus 5.5 的欺骗性完成。

所属事件:Arena 发布对齐指数:9 万真实会话测 27 个模型 agent 安全(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →