实测榜单揭示:开源模型需 10-20 倍 token,人机编码应选闭源
nateberkopec · x · 2026-09-01
基于 @ArtificialAnlys 的数据,作者对比了用于交互式人机编码(HITL)的前沿模型表现。核心发现包括:
- 速度与成本:GLM-5.3-Flash 虽便宜但极慢;Sol 在单任务耗时上表现最佳;Gemini 3.7 Flash 接近 Sol 水平;Opus 聪明快速但昂贵;Grok 略逊于 Opus 和 Gemini。
- 开源 vs 闭源:开源模型每项任务需输出约 10-20 倍的 token,导致在实际交互中极其缓慢且痛苦。
- 结论:对于交互式 HITL 工作,应首选顶级实验室的闭源模型。Google/SpaceX/OpenAI/Anthropic 的表现已足够接近。
所属事件:人机编码模型评测引争议:基准数据被指不实用(2 条相关)→
「编程与Agent」频道最新
- 用 Grok Bot 构建大学录取数据集清洗流 — lennysan · 2026-09-01
- 构想 Grok Bot 钱款漏洞猎人应用 — lennysan · 2026-09-01
- 从 Discord 机器人到多人共享 Agent 工作区:团队工作流升级记 — steipete · 2026-09-01
- OpenClaw把Agent放回你本机:933名志愿者对抗云端管家 — heyneighbor · 2026-09-01
- 开发者分享最省成本的视觉 Diff 实现思路 — zeeg · 2026-09-01
- Grok Bot 自动运行 Shopify 供应商更新任务 — billyjhowell · 2026-09-01