LLM 始终学不会的一件事:给子任务挑对模型

DynaBeast · reddit · 2026-09-28

作者观察到一个几乎所有模型都通不过的考验:让一个协调型 agent 自己挑选合适的子模型来干活时,95% 的情况下它只会选自己同款模型,不管这对任务是严重过剩还是不够用。让 Fable 去雇一个下属来居中一个 div,它会再雇一个 Fable;让 Luna 从零设计一个全新实验项目,它还是雇一个 Luna。

即便在 prompt 里明确要求按任务选合适模型,除非任务简单到任何模型都能做,错误率仍超过 70%。作者认为「为每个任务判断该调用哪个模型」是少数 LLM 至今没能超越人类判断的领域——不算最难的题,却没有一个模型接近可用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →