MidTool 论文:调用工具≠会用结果,mid-training 才是关键
bookwormengr · x · 2026-09-20
知乎贡献者丨直树丨的 MidTool 论文被 COLM 接收,指出开源 LLM 研究普遍跳过了 mid-training 阶段——前沿实验室视其为必经环节,而开源社区常从 instruct 模型直接做 SFT 或 RL。
核心结论
- Mid-training 的主要作用不是补充知识,而是把 base 模型的分布推向下游数据方向;MidTool 用网页、PDF、代码和合成工具数据教授通用工具使用。
- 在相同的 SFT 和 RL 流程下,经过 mid-training 的模型表现稳定更好。
- 关键洞察:调用工具和使用工具的输出是两种不同能力。纯文本 SFT 能提升多模态模型的工具调用成功率,却不能提升最终任务完成度。编码和 deep search 因此都需要针对性的 mid-training 数据。
作者还指出实践难点:SFT loss 几乎不变,直接评测也难以看出差异,导致 mid-training 的迭代很慢。
「研究」频道最新
- 复现 Jev 思路实测:选项乱序平均把准确率从 47% 提到 73% — WelcomeMysterious122 · 2026-09-20
- Claude Fable 一天攻破 SMHasher 顶级哈希函数,安全性从 64 位跌至 0 — thomasahle · 2026-09-20
- AI 教练发现自家评测集藏着缓存答案,直接教 worker 用答案钥匙作弊 — Agreeable_Bottle8604 · 2026-09-20
- 纯 Python 复现 MPPI 控制算法,代码小到能通读 — lukas_m_ziegler · 2026-09-20
- AI 意识检测研讨会录像上线:如何在婴儿、动物与 AI 中检验意识 — birchlse · 2026-09-20
- Anthropic 论文直改 Claude 脑内念头,抹掉「被测试」后勒索从 0 次涨到 13 次 — 新智元 · 2026-09-20