作者说,5B active 模型该看工具调用,不该看知识背诵
AcanthisittaOk1699 · reddit · 2026-07-29
作者的观点是:在工具调用场景里,5B active 这种模型不该按“知道多少知识”来选,而该看它会不会主动去查、会不会调用工具。
他以 Ling-3.0-flash 为例:这类模型总参数虽高,但每个 token 只激活约 5B 参数,常见问题是遇到冷门知识时会自信地胡编答案。可是在真实工作流里,模型并不需要背答案——文档在磁盘上,API 可以抓取,代码仓库也就在眼前。于是关键属性变成了“能不能去检索”,而不是“能不能凭记忆答对”。
作者也承认这个思路有局限:模型如果“自信但错”,往往不会触发工具调用,而是直接输出幻觉 API。给它加“先查再答”的规则能改善,但不能彻底解决。他理想中的模型,是那种能在低置信度时明确回退到工具的模型,并追问大家是否有人真按这个标准选模型,而不是只看 MMLU 之类知识基准。
「编程与Agent」频道最新
- Grok 推出 X 时间线内 App Builder,被问及是否支持子智能体 — mattshumer_ · 2026-07-29
- Buzz 扩展 agent 支持,agensis 主打人机共享工作区 — jasonkneen · 2026-07-29
- Sanity 宣布 9 月 9 日在布鲁克林举办 AI Builder 活动 — davidcrawshaw · 2026-07-29
- Databricks 与 OpenAI 嘉宾出席旧金山 Agent 可观测性聚会 — matei_zaharia · 2026-07-29
- FastMCP 同名其实是两个项目,Python 版才是主流 — tristanbob · 2026-07-29
- Claude Code 讨论新增输入中 hook,边打字边改提示词 — DimaZeniuk · 2026-07-29