ToolCPT 范式:180亿token预训练注入工具知识
青稞AI · wechat · 2026-08-25
论文提出 ToolCPT 范式,主张在持续预训练(CPT)阶段为模型注入结构化“工具知识”,而非依赖传统的后训练微调(SFT),以解决模型在分布外(OOD)或复杂工具场景下泛化差的问题。
核心方法(数据管线):
- 代理工具挖掘:从代码库挖掘出 510 万个符合智能体调用标准的“代理工具”。
- 工具手册(Playbook)生成:为每个工具生成结构化手册,涵盖基本信息、背景、调用方法、协同逻辑及错误分析(弥补现有 SFT 仅含成功路径的缺陷)。
- 模板化预训练:将接口、代码与手册按“科普文章”格式拼接,构建 180 亿 token 的语料库进行持续预训练。
实验结论:
- 挖掘出的代理工具与真实世界的智能体工具(如 MCP 协议工具)高度对齐。
- 经 ToolCPT 训练的模型在多个 Agent 基准测试中显著提升,尤其在复杂工具协同和错误恢复任务上鲁棒性更强。
核心启示:
- 将工具学习“前移”至预训练阶段,实现知识深度内化。
- 证明了无需昂贵人工标注,通过自动化管线即可提炼高质量 Agent 预训练语料。
「研究」频道最新
- 机器人公司 Eidon AI 关停,9TB 自我中心视频与 IMU 数据全部开源 — vanstriendaniel · 2026-09-21
- 阿里浙大发布 Astar:从系统进化史自学,工程师新想法效率提 10-100 倍 — jiqizhixin · 2026-09-21
- NGCC 后量子密码候选曝 16 个严重漏洞,官方论坛噤声后研究者自建站点 — jedisct1 · 2026-09-21
- FANUC 展出会绕着人走的协作机器人,用强化学习与实时重规划 — lukas_m_ziegler · 2026-09-21
- 用实验功能数据训练模型,显著提升肿瘤反应性 TCR 预测 — bravo_abad · 2026-09-21
- MBZUAI 发布价值冲突数据集,用任务向量给 LLM 装上价值观开关 — MBZUAI · 2026-09-21