最新编码模型实测:GPT-5.6 退步,Grok-4.5 夺魁
sergeykarayev · x · 2026-08-05
一位开发者分享了团队对最新一代编码模型的实测体验,认为最近的升级并非全是利好:
- Claude 3.5 Opus / Fable 5:在任务彻底性上远超其他模型,但并不适用于所有日常任务,且极易耗尽使用额度。
- GPT-5.6 Sol:在编写代码方面往往不如 GPT-5.5,部分团队成员因此降级,尽管它在文案写作上表现更好。
- Grok 4.5:作者因速度优势将其换为日常主力模型。
作者由此提出疑问:AI 的编码能力是否已经达到了“足够好”的平台期?
「编程与Agent」频道最新
- Karpathy 实测 Claude Opus:2小时写5500行代码渲染3D世界 — jon_barron · 2026-08-05
- Codex 的强迫症:写代码时总忍不住狂查 SKILL.md — dejavucoder · 2026-08-05
- Claude结合Blender MCP:描述需求即可自动构建并修复3D场景 — jamestagg · 2026-08-05
- 开源模型遇瓶颈:长周期智能体任务表现拉胯 — bindureddy · 2026-08-05
- ComfyUI 新节点:一键生成 PBR 材质并同步至 Blender — Scared-Sandwich1283 · 2026-08-05
- 护栏为何拦不住恶意指令?Agent 工具调用安全机制反思 — eazyigz123 · 2026-08-05