Scale 发布 MCP 工具调用评测,Kimi K3 领跑开源模型

LiTianleli · x · 2026-07-31

Scale Labs 更新了 MCP Atlas 评测榜单,该基准专门用于评估大语言模型在真实场景下的多步骤工具调用能力(包含 1000 个任务和 36 个 MCP 服务器)。

根据最新评测结果,Kimi K3 在开源模型中位列第一,并在长程工具调用中击败了 Gemini 3 flash lite 和 GPT 5.6 luna 等闭源模型。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →