小模型编排在 100 题任务中把完成率大致翻倍

_raydeStar · reddit · 2026-07-29

一位本地模型实践者报告说,大多数编排技巧在小模型上都失败了,但剩下的 10% 方案把任务完成率大约翻了一倍。

帖子强调这更像一个工程问题:作者用 100 题的可验证任务集测试后发现,scaffolding 并不能让模型学会更多事实,但能显著提升“把任务做完”的能力。文中给出的结果包括:LFM 1.2B 从 15/100 提升到 32/100,LFM 2.5 8B 从 24/100 到 48/100,Gemma 4 26B-A4B 从 23/100 到 56/100,Luna 从 22/100 到 66/100;同时作者强调结果必须可复现、要使用工具,并避免模型靠硬编码答案作弊。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →