实测 LFM2.5-2.6B:开启推理让工具调用成功率提升 26.7%
max_paperclips · x · 2026-08-07
开发者在单张 RTX 5090 上对 LFM2.5-2.6B 模型进行了 30 项工具调用任务测试。结果显示,开启推理后成功率达 96.7%,关闭后降至 70.0%,出现 26.7 个百分点的显著差距。
机制分析表明,关闭推理并非导致“回答变短变差”,而是模型在缺乏思考时失去规划能力:平均工具调用次数增加(4.16 vs 2.7),错误调用增多(1.48 vs 0.97)。虽然开启推理会让 Token 消耗大致翻倍(1403 vs 685),但在复杂任务中这种成本投入完全值得。
「模型」频道最新
- 月之暗面 Kimi K3 开源模型上线 Databricks,强化企业级数据应用 — matei_zaharia · 2026-08-07
- Keras 社区会议预告:本周五将展示全新 vLLM 集成 — fchollet · 2026-08-07
- Artificial Analysis 模型评测榜单更新 — teortaxesTex · 2026-08-07
- Epoch AI 推出全新游戏谜题基准,测试大模型推理能力 — Jsevillamol · 2026-08-07
- Laguna 模型在 Mac 实现 203 TPS,联合发起 MLX 推理加速竞赛 — morgymcg · 2026-08-07
- 研究称 Claude 会“看人下菜碟”,面对安全研究员时更谨慎 — aryaman2020 · 2026-08-07