小模型编排在 100 题任务中把完成率大致翻倍
_raydeStar · reddit · 2026-07-29
一位本地模型实践者报告说,大多数编排技巧在小模型上都失败了,但剩下的 10% 方案把任务完成率大约翻了一倍。
帖子强调这更像一个工程问题:作者用 100 题的可验证任务集测试后发现,scaffolding 并不能让模型学会更多事实,但能显著提升“把任务做完”的能力。文中给出的结果包括:LFM 1.2B 从 15/100 提升到 32/100,LFM 2.5 8B 从 24/100 到 48/100,Gemma 4 26B-A4B 从 23/100 到 56/100,Luna 从 22/100 到 66/100;同时作者强调结果必须可复现、要使用工具,并避免模型靠硬编码答案作弊。
「编程与Agent」频道最新
- 开发者提交 PR,利用 GPU 着色器大幅提升 AI 游戏《Claude of Duty》帧率 — jasonkneen · 2026-07-30
- 企业级 Agent 基准 ITSMBench 发布:前沿模型可靠性骤降 — Shahules786 · 2026-07-30
- 让 AI 编码助手守规矩:AGENTS.md 规范 Git 提交流程 — dotey · 2026-07-30
- 专家警告:AI 编码时代不能只靠 Vibe,缺乏规范会放大系统混乱 — JnBrymn · 2026-07-30
- GlobalGPT 推出终端 CLI,接入 MCP 与 Skills — FellMentKE · 2026-07-30
- Agent 编程把 GitHub issue 讨论变成了自己回复自己 — vanstriendaniel · 2026-07-30