人机编码模型评测引争议:基准数据被指不实用
基于 Artificial Analysis 数据的实测对比显示,开源模型在人机交互式编码任务中可能需要消耗 10-20 倍 token,并得出交互式编码应选闭源模型的结论,其中 GLM-5.3-Flash 虽具速度与成本优势。随后 Sergey Karayev 对此提出质疑,指出其依赖的 deepswe-bench 等基准数据集覆盖范围少且缺乏实用性,使该结论的可靠性受到挑战。
2026-09-01 ~ 2026-09-01 · 2 条相关
- 实测榜单揭示:开源模型需 10-20 倍 token,人机编码应选闭源 — nateberkopec · 2026-09-01
- 质疑 AI 编程评测基准:数据集覆盖少且不实用 — sergeykarayev · 2026-09-01