Haiku 5.5 又便宜 75% 又反超 Opus 5,网友讥讽「毫无意义的基准」
rickasaurus · x · 2026-10-08
Layton Gott 盘点 Anthropic Haiku 5.5 的反常成绩:比前代更聪明,运行成本再降约 75%,且在 GDPval(1620 vs 1596)和 AA-Briefcase(1578 vs 1562)两个知识工作基准上反超自家旗舰 Opus 5,仅 HLE 和 Terminal-Bench 4.0 落后。rickasaurus 引用并反讽「显然这些基准毫无意义」,暗指榜单数字与真实体验脱节的荒诞感。
所属事件:基准测试接连被刷穿 AI评测体系遭质疑(2 条相关)→
「Fun」频道最新
- 从做小玩意到跑 Minecraft 服务器,独立开发者公开招募插件开发 — jaivinwylde · 2026-10-08
- 机器人格斗太危险,主办方干脆给机器人装上剑 — cixliv · 2026-10-08
- Reddit 用户发布暗黑奇幻系列《THE FOREST》第二集 — FauxFeast · 2026-10-08
- 722 篇 AI 生物论文 0 治愈癌症,生物学家喊话科技大佬:真做太难 — iScienceLuvr · 2026-10-08
- OpenAI DevDay 社区用 Codex 把复古掌机变成游戏开发平台 — OpenAIDevs · 2026-10-08
- 网友让 AI 代订鲜花搞砸求婚场合:千万别让 AI 买花 — geoffwolfe · 2026-10-08