LLM 始终学不会的一件事:给子任务挑对模型
DynaBeast · reddit · 2026-09-28
作者观察到一个几乎所有模型都通不过的考验:让一个协调型 agent 自己挑选合适的子模型来干活时,95% 的情况下它只会选自己同款模型,不管这对任务是严重过剩还是不够用。让 Fable 去雇一个下属来居中一个 div,它会再雇一个 Fable;让 Luna 从零设计一个全新实验项目,它还是雇一个 Luna。
即便在 prompt 里明确要求按任务选合适模型,除非任务简单到任何模型都能做,错误率仍超过 70%。作者认为「为每个任务判断该调用哪个模型」是少数 LLM 至今没能超越人类判断的领域——不算最难的题,却没有一个模型接近可用。
「编程与Agent」频道最新
- Gemini 可替 Pixel 用户致电商家订位查货,AI 表明身份 — rvp · 2026-09-28
- Anthropic 硬件标准 MHS 能否打通工厂旧设备与 AI 的连接 — burhop · 2026-09-28
- IndicBankBench:799 例基准测银行 AI 助手,最高可靠率仅 58.2% — NPCI · 2026-09-28
- Grok 4.8 曝光:已现身 Cursor 服务端模型列表,距 4.7 发布仅一周 — gaganghotra_ · 2026-09-28
- 让 AI 边干活边教学:把 ELI5 写进记忆的实用工作流 — thejasminejade · 2026-09-28
- Claude Code 一小时速成课:学会用 AI 构建与自动化一切 — anthara_ai · 2026-09-28