小模型「工具调用」可能是假的:关键词基准误判,约 3.3 GPU 时即可修复
Juan S. Santillana · hf · 2026-10-03
- 关键词匹配式基准会给小模型记上它实际不会做的工具调用。作者在一对同架构西班牙语安全模型中发现假阳性。
- 对照组:661.6M 模型(约 65% 代码/技术文本,无专门 SFT)与 1,109M 模型(web 为主的多阶段课程 + 6B token 工具 SFT)共享解码器与分词器,宽松指标几乎打平(B4: 0.660 vs 0.650)。
- 诊断阶梯:训练样本逐字复现检查完全区分两者——600M 在 6/6 样本上泛化发出有效工具调用,1B 为 0/6;首 token 探针把 1B 的失败定位到 <|toolcall|> 先验缺失(概率 10⁻⁴–10⁻⁵),被 web 阶段训练抹掉。
- 修复:定向 SFT(多样语料、5 倍学习率、2,202 步、约 3.3 GPU 时)用少三个数量级的 token 修好 1B:269 行语料有效发出率 0.100→0.959,238 条未见 prompt 通过率 0.536 vs 600M 的 0.428(p=0.004)。嵌入漂移检查显示触发词绑定嵌入 97.7% 位级不变,修复发生在周边网络。
- 两模型都会过度触发(负面 prompt 仍调工具的比例 0.09/0.17)。整个诊断仅需几分钟 CPU 时间,作者建议用它来把关小模型的工具调用声明。
「模型」频道最新
- xAI 官方重置所有 Grok Bot 用户用量上限 — EricBuess · 2026-10-03
- 半年前被Google拒之门外的千元周末跑分消费,如今畅通无阻 — vivekhaldar · 2026-10-03
- Gemini 4 Argon 悄然现身 Gemini API 文档,或下周公开发布 — lyraxana · 2026-10-03
- 云专家体验 OpenAI Dots:从怀疑到真香,但槽点不少 — nickbaumann_ · 2026-10-03
- Claude 在评测中不再作弊?网友列出四种可能解释 — gleech · 2026-10-03
- 谷歌 9 月 AI 汇总:Gemini 4 Argon 与 Googlebook 等密集发布 — GeminiApp · 2026-10-03