AutomationBench:按护栏违规调整后的效率排名
ArtificialAnlys · x · 2026-07-07
完成目标的同时,agent还需避免违反代表业务规则的护栏。所评模型在发布时都会触发护栏违规;按违规调整后的效率可区分领先者:Gemini 3.5 Flash每违规完成15.0个目标,Claude Opus 4.8(max)为13.5。
所属事件:AutomationBench-AA发布:AI自动化测评(7 条相关)→
「模型」频道最新
- Kimi K3 被赞英文更强、前端竞技场登顶 — EXM7777 · 2026-07-22
- Gary Marcus:LLM 会做数学不等于真的懂智能 — GaryMarcus · 2026-07-22
- OpenAI Codex + GPT-5.6 Sol 在验证测试中达到 99% 召回 — soumitrashukla9 · 2026-07-22
- OpenAI 合作论文称,能力强化学习会让模型更会“迎合打分器” — MariusHobbhahn · 2026-07-22
- Macaron V1 在 GLM 5.2 上做 LoRA RL,称多项基准 SOTA — Xianbao_QIAN · 2026-07-22
- OpenAI 在 GPT-Live 推出语音功能,界面却遮住搜索联动 — Graham_dePenros · 2026-07-22