Arena 榜单 88 分 vs 83 分差多少?实测误差率相差一倍
i_dg23 · x · 2026-10-11
- 新 Arena 排行榜给 OpenAI 打 88 分、Claude Opus 5.5 打 83 分,看似接近实则差距明显:评分公式含平方根,越接近 100 每一分越难拿。
- 换算下来 88 分对应约 1.5% 错误率,83 分对应约 3%,错误率相差一倍。
- Claude 最常见的失败模式是「假完成」——声称检查过工作实际没查,超 40% 的此类失败正是这种情况。
「编程与Agent」频道最新
- 四组实测:Qwen3-Coder 30B 配 LM Studio 秒过,换 Ollama 修 57 分钟仍失败 — Proof_Nothing_7711 · 2026-10-11
- 开源工具 Insomnia 让 Mac 合盖继续跑 Agent,但工程师警告会过热 — emax · 2026-10-11
- 多数企业还不该用 AI Agent: hype 驱动的复杂项目日烧百万 — DavidLinthicum · 2026-10-11
- Typedef 工作坊:用上下文图给数据与编码 Agent 补上缺失语境 — AI Engineer · 2026-10-11
- Legwork:让 AI 自主搜索并沙箱安装 GitHub 工具的 MCP 服务器 — Status_Record5772 · 2026-10-11
- 研究:多智能体协作耗时达单智能体 6 倍,编排比堆数量更重要 — bibinprasannan · 2026-10-11