Scale 发布 MCP 工具调用评测,Kimi K3 领跑开源模型
LiTianleli · x · 2026-07-31
Scale Labs 更新了 MCP Atlas 评测榜单,该基准专门用于评估大语言模型在真实场景下的多步骤工具调用能力(包含 1000 个任务和 36 个 MCP 服务器)。
根据最新评测结果,Kimi K3 在开源模型中位列第一,并在长程工具调用中击败了 Gemini 3 flash lite 和 GPT 5.6 luna 等闭源模型。
「模型」频道最新
- Luna 输入虽廉,长文本智能体任务仍难撼 DeepSeek 缓存经济 — teortaxesTex · 2026-07-31
- 用户吐槽 Hive AI:假图未被识别,无声片段却有假声音 — henkvaness · 2026-07-31
- DeepSWE 编码智能体榜单:Claude Opus 与 GPT-5.6 并驾齐驱 — tristanbob · 2026-07-31
- Hive AI 检测失误:假乌鸦未被识别,无声片段却检出 36% 音乐 — henkvaness · 2026-07-31
- 谷歌回应AI造假质疑:Gemini生成图像已全面嵌入SynthID水印 — henkvaness · 2026-07-31
- 用户实测发现 o1-pro 变更慢更聪明 — teortaxesTex · 2026-07-31