Terminal-bench 榜单:Kimi 夺冠,DeepSeek 第二
SergioPaniego · x · 2026-08-24
Terminal-bench 被认为是去年最重要的基准测试之一,包含 89 个高质量任务(如修复 OCaml GC bug、恢复 SQLite 数据库),用于指导本地 Agent 的高效发展。
最新排行榜:
- 🥇 Kimi k3
- 🥈 DeepSeek V4 Pro
- 🥉 Alibaba Qwen Max
- 荣誉提名: Qwen 3.8 27B(128B 参数以下最佳模型)。
「模型」频道最新
- Gemini 桌面版将支持头像,Gemini 4 筹备迹象显现 — testingcatalog · 2026-08-24
- ToMoE 论文:无需微训即可将稠密模型转为 MoE — pmttyji · 2026-08-24
- dots3-note 模型发布:16B 活跃参数专注长程任务 — rohanpaul_ai · 2026-08-24
- 汤森路透发布自研 LLM Thomson,成本极低 — schwarzjn_ · 2026-08-24
- DeepSeek V4 Flash 解题全流程曝光:冗余推理严重 — mhmazur · 2026-08-24
- TielCoder 22GB 版实测:媲美 Opus4.6,胜过 KAT-Coder — peculiar-ragdoll · 2026-08-24