BuildingBench 榜单:GPT-6.1 Sol 得 85.1 分,成本仅 Opus 5.5 的 1/27
ZhitingHu · x · 2026-10-01
EnactraAI 发布 BuildingBench 建筑任务排行榜更新,两款新模型排名大幅上升,但走的是完全不同的成本路线。
- GPT-6.1 Sol:得分 85.1(上一代 GPT-6 Sol 为 69.6),升至第二;单栋建筑中位成本从约 $1.89 降到 $1.70。它以低 76% 的成本超过 GPT-6 Astra ultra(84.3),距榜首 Opus 5.5 max(86.8)仅 1.7 分,而成本约为其 1/27
- Sonnet 5.5 max:从 Sonnet 5 的 54.4 跃升 22.5 分至 76.9,排名第五;但代价是成本从 $15.03 涨到约 $39.99 每栋建筑
结论:两个大提升、两种定价策略——一个主打性价比逼近榜首,一个用高价换质量跃升。
「模型」频道最新
- Reddit 帖称 GPT-6.1 Sol 冲进 Humanity's Last Exam 第三 — 141_1337 · 2026-10-01
- Burkov 周报第 180 期:小米开源 MiMo-V2.6、物理学家式剪枝 LLM 等 — burkov · 2026-10-01
- Perplexity 发布 pplx-embed-v2-context-9b,登顶 ConTEB 上下文嵌入榜 — perplexity_ai · 2026-10-01
- Reddit 用户称更新重装 Codex 后数天工作量凭空消失 — Unknown6334 · 2026-10-01
- OpenAI 首次指控中国实验室蒸馏:4 天 1.6 万次请求窃取隐藏推理 — rohanpaul_ai · 2026-10-01
- KOL 观察:AI 领先权轮替快,网友对 OpenAI 的抱怨正重演 Anthropic 剧本 — haider1 · 2026-10-01