LLM 功能上生产环境真正会翻车的地方,一线开发者复盘五大坑
Early-Sir-932 · reddit · 2026-09-30
一位开发者复盘 LLM 功能遇到真实用户时的失败经验:demo 看着没问题,是因为没遇到混乱的真实场景;生产环境的故障几乎不在模型本身,而在没人想到的外围层。
- 没有 eval 集:没有可重跑的小型评分集,每次改 prompt 或换模型都只能凭感觉,无法判断是改进还是把错误换了个方向
- prompt 级护栏不是执法:模型自信时会说服自己绕过规则,真正重要的限制必须写成确定性的代码
- 成本失控:重试无幂等性、无缓存、无论任务多简单都路由到大模型
- 垃圾输入:直接喂原始 PDF、抓取页面和带噪声的 HTML 不会有好输出;文档处理应引入 docling 或 llamaparse 之类解析器,还能降低幻觉
- 静默失败:返回看似合理实则错误,直到用户工单才发现;没有逐步 tracing 就无法定位哪里出错
「编程与Agent」频道最新
- RemCTL 2.0:把 Apple 提醒事项做成 ChatGPT 原生扩展 — rudrank · 2026-09-30
- Claude Code 送 $250 云端额度,输入 /claim-credit 即可领取 — daniel_mac8 · 2026-09-30
- 新论文:让工具型 Agent 学会主动追问用户没说的信息 — LChoshen · 2026-09-30
- MCP 创建者发声:Figma 白名单式限制有违开放生态初衷 — dsp_ · 2026-09-30
- 开发者晒每月 $500 AI 编码预算:Claude Code 与 Codex Pro 各占 $200 — jarrodwatts · 2026-09-30
- 纯 Java 实现的编码 CLI 开源:CadetCoder 基于 ARC-AGI-3 冠军 harness — akumaburn · 2026-09-30