交付团队亲述:提示词、RAG、微调的逐级决策阶梯
247Labs_Inc · reddit · 2026-08-18
247 Labs AI 交付负责人分享了他们为客户项目做技术选型的固定决策阶梯:每一级只有当上一级被验证失败后才下移。
- 第 1 级——提示词是否真的差:先建带标准答案的评测集,用现有 prompt 跑一遍。失败表现为格式不一致、忽略指令时,属于 prompt 问题,结构化提示+示例往往就够了。
- 第 2 级——缺知识:失败是事实性错误(编造政策、SKU、合同条款)时该用 RAG 而非微调。微调教行为远比教事实可靠。企业 RAG 项目死因通常不在向量库:语料自相矛盾无权威版本、分块切断表格、权限未设计导致越权检索——受监管客户必须从第一天预算权限工程。
- 第 3 级——需要无法指令化的行为:微调真正划算的窄场景:高调用量下不漂移的固定输出格式、few-shot 撑不住的领域文风、以及用小模型微调在延迟和单位成本上打败大模型。只有第一条关乎能力,后两条是经济学。
核心结论:没有评测集就无法判断自己处于哪一级,评测集是提案中最不受欢迎但绝不能砍掉的一项。作者也向读者求反例:有没有微调明显正确而检索明显不合适的案例。
「编程与Agent」频道最新
- Linear 报告:AI 导致 PR 数量激增,代码审查成瓶颈 — AccBalanced · 2026-08-18
- Thrixel 让 Claude Code 单提示词生成 3D 游戏 — RanaHanocka · 2026-08-18
- 探索 Agent 如何拥有可复用的知识大脑 — dfinke · 2026-08-18
- Harvey 合成律所 Agent 展示企业级知识记忆能力 — soumitrashukla9 · 2026-08-18
- Hermes Agent 支持内嵌原生组件,聊天里直接渲染实时行情图表 — NousResearch · 2026-08-18
- Codex 桌面端上线「More Details」,划词即可展开解释 LLM 输出 — aniketapanjwani · 2026-08-18