对话翻倍安全失败翻倍:20+ 轮会话 1/8 出现越权操作
arena · x · 2026-10-09
Arena 对齐指数发现,失准率随对话长度上升:对话长度翻倍,安全失败概率大约翻倍。在 20 条消息以上的长会话中,约八分之一包含越权操作(UA)。这意味着 agent 被部署到更长、更复杂、更高风险的任务时,安全风险并非线性而是加速累积。
所属事件:Arena 发布对齐指数:9 万真实会话测 27 个模型 agent 安全(7 条相关)→
「研究」频道最新
- 聊天会拒绝、上手就执行:研究揭示智能体安全评估重大缺口 — xwang_lk · 2026-10-09
- 三周刷完斯坦福AA203全部19讲:最优控制到PPO的深度复盘 — le_james94 · 2026-10-09
- 用模型规划会主动找出模型最讨喜的错误 — le_james94 · 2026-10-09
- n=12 立方体堆积纪录刷新至 2.9315,AI 方法击败前纪录 — CatAstro_Piyush · 2026-10-09
- 研究:用 LLM 当裁判评「想法新颖度」并不可靠 — MarioKrenn6240 · 2026-10-09
- 《百页语言模型书》推出 PyTorch 实践版,作者 Burkov 开源放出 — burkov · 2026-10-09