AutoCAD-Bench 测试精确 CAD 任务,GPT 5.6 sol 以 46% 领跑
DevvMandal · x · 2026-07-24
AutoCAD-Bench 发布:用 computer use 测试模型能否完成精确 CAD 任务
DevvMandal 发布了 AutoCAD-Bench,这是一个专门评估 AI 模型是否能仅靠 computer use 完成精确 AutoCAD 操作的基准。
- 这个基准关注的是实际 CAD 操作能力,而不是纯文本问答。
- 图表显示,GPT 5.6 sol 以 46% 领跑,并被描述为能一次性完成不少基础和中级任务。
- 其他结果包括 Terra 14%、Fable 5 10%、Luna 8%;Opus 4.8、Kimi K2.5、Qwen3.7 在这套测试里均为 0%。
帖子还提到完整报告里有更详细的方法和结果。
所属事件:AutoCAD-Bench发布,精准评测AI模型执行CAD任务能力(3 条相关)→
「模型」频道最新
- 微软称 MAI 模型已路由进 Copilot、Excel 和 Outlook — satyanadella · 2026-07-24
- 用户称 OpenAI 实用性已甩开 Opus 4.8 一个档次 — FlorianGallwitz · 2026-07-24
- OpenAI 与 Anthropic 同框:前沿实验室竞争进入“永不睡觉”状态 — MeetPatelTech · 2026-07-24
- GPT-5.6 挑战《杀戮尖塔》,直播实测展现惊人游戏能力 — Jsevillamol · 2026-07-24
- Laguna S-2.1 GGUF 修复 chat template,思考和工具调用都更稳 — fragment_me · 2026-07-24
- Grok 4.5 登陆 iOS、Android、网页和 X,强化编程和长上下文 — mark_k · 2026-07-24