把 LLM 功能开放给公众前,我补的 7 道防线没有一道是提示词
clementds · reddit · 2026-10-07
Reddit 用户 clementds 复盘自己上线「课程笔记转闪卡」LLM 功能的工程经验:让模型输出质量达标只占 20% 的工作,剩下全是工程防护。
他的清单(按踩坑顺序):
- 用户内容加分隔符:粘贴文本包进显式标签,区分指令与数据,否则粘贴内容可改变模型行为
- Grounding 按模式拆分:「跑题检测」对主题生成和粘贴笔记两种模式语义不同,后者应以原文为准,拆成两个检查更可靠
- 双层限流:每 IP 限速防单人耗尽,加全局日额度防一次事故变一张账单
- 供应商错误不出网关:原始报错会泄露细节且不可读,对用户给干净文案、日志里存全量
- 强制输出语言:只在提示词里要求不够,错语言出现频率高到必须当 bug 处理
- JSON 解析要容错:返回可能包在代码块甚至句子里,不能信文档格式
- 保存前可编辑预览:产品层面的信任设计,比上面所有安全措施更能建立信任
「编程与Agent」频道最新
- 开发者开源 Jev:让 PowerShell 脚本调用小模型做结构化决策 — dfinke · 2026-10-07
- 梵高《星夜》小镇生成器更新:实时笔触流场终被做出来了 — simonxxoo · 2026-10-07
- 投资人实测:ChatGPT 与 Claude 做退休投资建议全都不可信 — MartinGTobias · 2026-10-07
- AI 逆向出整套 Adobe 套件开源实现,「闭源软件已死」引热议 — wen_ragnarok · 2026-10-07
- Teknium 修复 Hermes Agent 后台审查丢失用户自有技能教训的 bug — Teknium · 2026-10-07
- Java Vector API 实战:JDK 16 起可直接写 SIMD 榨干单核性能 — lemire · 2026-10-07