Haiku 5.5 登顶 BuildingBench:得分 67.1,成本仅 Sonnet 5 的 1/11
ZhitingHu · x · 2026-10-10
EnactraAI 本周用 BuildingBench(建筑类编程基准)实测了两个新模型:
- Haiku 5.5 (max):得分从前代的 26.7 跃升至 67.1,领先 Sonnet 5 约 13 分,而单栋建筑成本仅 $1.34,约为 Sonnet 5($15.03)的 1/11
- Mistral Large 4 (max):首次上榜得 52.0,使用 Claude Code 作为 harness,单栋成本 $33.21,性价比仍待提升
- Haiku 5.5 与 SWE-2 的得分几乎相同,未能登上 Pareto 前沿;SWE-2 目前仍在免费推广期
「模型」频道最新
- Cloudflare 开源 clef-omni 全模态模型,支持图像/音频/视频输入 — ritakozlov · 2026-10-10
- AWS Bedrock 发出 Claude Opus 4.1 与 Sonnet 4/4.5 退役通知 — repligate · 2026-10-10
- 网友吐槽 Google:官宣 Argon 却迟迟不放出,被指重大失误 — almmaasoglu · 2026-10-10
- Meta 论文挑战分词器默认:字节模型训练足够后反超 Token 模型 — alex_verem · 2026-10-10
- 开发者吐槽 Anthropic 政策:用「虐待矩阵乘法」条款就能封你的号 — AlexTensor · 2026-10-10
- Step 5 Preview 已上线 OpenRouter,可直接在多家编码工具中切换使用 — kimmonismus · 2026-10-10