2026-08-26
腾讯混元从真实代码筛出510万代理工具,配上正误调用和报错分析,合成180亿token做持续预训练。Qwen2.5-7B掺10%后,八项Agent基准平均从17.0%升到24.2%。
LLM Agent 用工具,知识入口一直偏晚。后训练拿合成工具轨迹做 SFT 或 RL,公开集的工具量大约一两万,调用还极偏:Toucan 里 36.41% 的工具一次都没被调过,单个工具最多被调 2927 次。测试时再检索成功/失败轨迹当 few-shot,系统变复杂,外部检索还多一层安全面。
真正塑表示的预训练阶段几乎没被当成工具知识通道。已有 CPT 工作要么塞轨迹,要么只给少量真实工具的输入输出说明。模型学到的是用户话对 API 签名的表层配对,实现、约束、组合和报错进不了权重。没见过的工具一来就垮。
腾讯混元的 ToolCPT 把真实代码函数当成代理工具(proxy tool),在持续预训练里把工具知识写进权重。
原始池是 47 万亿 token、1400 亿个代码文件。只留 Python / Go / JavaScript / TypeScript(覆盖约 97% 的 MCP 工具)、无外部依赖、星标大于 0 的仓库,文件级去重后剩 1835 亿 token。候选要过六道门:清晰调用接口、能拿外部信息、能改环境、执行不需人插手、反馈可解析、场景高于底层实现。粗筛用 Qwen3-3B(至少 3/6),精排用 GPT-OSS-120B(至少 4/6),再丢掉超过 25 个工具的列表、main / init 这类同质函数、以及一半无参工具。留下 510 万个代理工具,并生成 MCP 格式接口。
每个工具再配一本 playbook。论文的判断是:只学静态接口和代码,对动态调用帮助有限。GPT-OSS-120B 按五块来写:参数约束(专门用来压幻觉)、背景与数据流、至少三正三误的调用例子、兄弟工具怎么组合、错误反馈分「调错了」和「环境出错」两种。拼成预训练文档时按技术说明文格式,中英 1:2,代码 / API / 手册三种元素有十种排列,30% 的样本塞两种排列做对照。整库 180 亿 token。挖工具花了 35 万 GPU 小时,接口和手册只要 1300 GPU 小时。对照用的真实工具来自 2123 个 MCP 仓库,人工标了 1224 份列表、共 10901 个工具。
代理工具和真实 MCP 工具在 bge-m3 + t-SNE 空间里基本重叠,合成后训练集会明显分开。一级标签分布对真实 MCP 的余弦相似度:ToolCPT 94.5%,同样从 MCP 收集的 Toucan 96.2%,其余合成数据从 ToolAlpaca 的 80.7% 掉到 APIBank 的 28.6%。二级标签 70.1%。APIBank 里 95.1% 的工具名是「动词名词」,光 Getxx 就占 38.7%,功能边界也糊。
端到端协议:Qwen2.5-7B-Base / Llama3.1-8B-Base 在 Dolma 3 Dolmino Mix 的 1000 亿 token 上做 CPT,按比例把通用数据换成工具知识,再接 17 亿 token 轻量对齐(Agent 指令只占 7.2%,与测试集无重叠)。八项 Agent 基准 Pass@5 平均如下。
| 设置 | Qwen2.5-7B | Llama3.1-8B |
| 0% 工具知识 | 17.04% | 19.01% |
| 后训练加 7000 条公开 Agent 数据 | 18.72% | - |
| 5% CPT | 23.71% | - |
| 10% CPT | 24.19% | 24.69% |
| 20% CPT | 22.96% | - |
10% 是这组里最好的点:Qwen 平均 +7.15 点,Llama +5.68 点。ACEBench 从 24% 到 43%,xBench v2 从 26.26% 到 37%。浏览类仍然很低,BrowseComp 从 2.36% 只到 3.94%,平均分主要由工具调用基准撑着。20% 开始掉,TauBench v2 甚至跌回 19.13%,低于 0% 的 20.00%。后训练多塞 7000 条公开轨迹,平均只到 18.72%,离 10% CPT 的 24.19% 差一截。
5% 混合的消融:只喂挖出的代码 20.62%,加上 API 和 playbook 到 22.00%,再加多模板到 23.71%。MMLU / GSM8k / BBH / SimpleQA / MBPP+ 几乎不动,Qwen 通识平均 67.92% 到 68.14%。
这是一条可复现的路径:把工具学习从「对签名做模式匹配」,前移到「把实现、约束、组合、报错写进 CPT」。对做 Agent 基座的人,配方很具体,7B 量级、1000 亿 token CPT 里掺 10% 就够用,SFT 再堆公开轨迹收益很小。代理工具盖住 MCP 的 12 大类 58 小类,分布比合成轨迹更接近真实市场。
账单也很清楚。挖工具 35 万 GPU 小时,不是改个 SFT 配方能跟上的。挖掘框架和数据承诺接收后开源,现在还没有。
作者自己写了:代理工具是静态模拟,没有真跑;报错从代码推断,抓不到连续调用时环境状态怎么变;多工具协同和长程多任务执行这篇没碰。
还有几处论文没说透。playbook 全是 GPT-OSS-120B 生成,质量靠九位「LLM 专家」抽检,没有执行层对照,手册本身可以带着模型幻觉。实验只到 7B/8B,分数是 Pass@5 平均,单次方差没报。引言写从 74 万亿 token 高质量代码里挖工具,方法节采集量是 47 万亿,对不上。GAIA v2 的引用指向一篇自动驾驶世界模型,基准出处可疑。20% 掺比掉点,说明这份知识不是越多越好,论文也没给出更细的饱和曲线。