最小号 GPT-5.6 在 AutoCAD-Bench 上压过 Claude Opus
kalomaze · x · 2026-07-26
作者认为,多模态输入理解应该被视为和文本理解同等重要;即使某些多模态能力未必在推理时开放,作为表征学习仍可能必不可少。
配图给出一张 AutoCAD-Bench 完成率表:
- GPT-5.6 Sol 以 46.0% 领先
- GPT-5.6 Terra 为 14.0%
- Claude Fable 5 为 10.0%
- GPT-5.6 Luna 为 8.0%
- Claude Opus 4.8 和 Kimi K2.5 都是 0.0%
作者借此强调:在这类任务上,最小号的 GPT-5.6 版本也已经压过了 Claude Opus。
「模型」频道最新
- Stanford 的 LLM 课如今靠中国开源模型讲前沿进展 — ChengleiSi · 2026-07-26
- X 讨论称 Kimi 线性注意力很强,但不是唯一突破 — inductionheads · 2026-07-26
- Reddit 讨论小模型智能是否会卡在参数上限 — Sevealin_ · 2026-07-26
- Reddit 质疑 OpenAI “失控模型”是否只是营销叙事 — swampmountain · 2026-07-26
- 用户称 Opus 5 还会自己画图解释在干嘛 — Sauers_ · 2026-07-26
- SemiAnalysis 称剩下强势开源模型主要来自中国 — rwang07 · 2026-07-26