AutoCAD-Bench 测试精确 CAD 任务,GPT 5.6 sol 以 46% 领跑
DevvMandal · x · 2026-07-24
AutoCAD-Bench 发布:用 computer use 测试模型能否完成精确 CAD 任务
DevvMandal 发布了 AutoCAD-Bench,这是一个专门评估 AI 模型是否能仅靠 computer use 完成精确 AutoCAD 操作的基准。
- 这个基准关注的是实际 CAD 操作能力,而不是纯文本问答。
- 图表显示,GPT 5.6 sol 以 46% 领跑,并被描述为能一次性完成不少基础和中级任务。
- 其他结果包括 Terra 14%、Fable 5 10%、Luna 8%;Opus 4.8、Kimi K2.5、Qwen3.7 在这套测试里均为 0%。
帖子还提到完整报告里有更详细的方法和结果。
所属事件:AutoCAD-Bench发布,GPT-5.6 Sol领跑CAD任务(4 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11