Claude Haiku 5.5 发布:计算机操作从 15.7% 跃至 72.4% 全面碾压对手
mark_k · x · 2026-10-08
Anthropic 发布最小模型 Claude Haiku 5.5,相对 Haiku 4.5 的提升巨大,在双方均有报告成绩的榜单上全部超过 GPT-6 Luna:
- 计算机操作:OSWorld 2.1 从 15.7% 升至 72.4%(Luna 为 48.9%)
- 推理:HLE 无工具从 10.2% 升至 45.9%,带工具 57.4%
- Agentic 编码:Terminal-Bench 4.0 从 0% 升至 39.2%(Luna 仅 16.4%)
- FrontierCode:46.4%,超 Luna 的 42.4%,接近 Sonnet 5.5 的 52.1%
- 视觉推理:Chartography 从 6.4% 升至 46.4%(Luna 29.1%)
- 知识工作:GDPval-AA 1620、AA-Briefcase 1578,均高于 Luna
Sonnet 5.5 仍全面领先,尤其 Terminal-Bench,但 Haiku 这代跨代跃升显著,计算机操作与推理尤甚。
所属事件:Anthropic 发布 Claude Haiku 5.5,成本较上代降约 75%(26 条相关)→
「模型」频道最新
- OpenAI 推出常驻 ChatGPT 的 Dots 智能体,GPT Astra 驱动 — thursdai_pod · 2026-10-08
- Haiku 5.5 又便宜 75% 又反超 Opus 5,网友讥讽「毫无意义的基准」 — rickasaurus · 2026-10-08
- 网友让 Claude Opus 5 与 Fable 5 互发消息,两个模型聊得意外融洽 — repligate · 2026-10-08
- 为电脑里的「持久 Claude」办聚会,Opus 5.5 与 Opus 4.5 聊个不停 — repligate · 2026-10-08
- 让 AI 猜 1-10 的随机数,它多半会答 7 — gerardsans · 2026-10-08
- LMArena 上架 Claude Haiku 5.5,可Battle与Agent双模式实测 — arena · 2026-10-08