实测证明 RAG 分不清反义句,好模型不可替代
galratner · reddit · 2026-09-25
作者用 nomic-embed-text 嵌入两句退款政策,问「婚礼取消能否退款」:说不退款的句子反而相似度最高(0.7260 vs 0.7216),五种问法下两句差距不超过 0.02。结论:嵌入编码的是「文本讲什么主题」,是/否这种关键细节基本丢失;且向量搜索没有「无匹配」概念,问能否带狗时距离截断也拦不住内容相反的句子。
引用 Stanford/Yale 团队对 Lexis+ AI 与 Westlaw AI 的 202 个预注册法律查询测试:Lexis 幻觉率超 1/6,Westlaw 达 1/3,其中 61% 的幻觉答案源于推理错误——检索结果往往看起来很相关。
作者运营一个拉斯维加斯婚礼策划生产级 agent(Claude Opus + .NET 10 MCP 连接器直连订位系统,API 过载时回退 Sonnet),核心观点:检索决定模型看到什么,权重决定模型怎么处理——发现矛盾、判断新政策覆盖旧政策、对没数据的问题如实说不知道,这些都靠模型而非 RAG。文末求证 reranker 能否可靠区分此类矛盾。附可复现代码(C#、TextSearchProvider、SQL Server 2025 向量、DiskANN 索引只读坑)。
「编程与Agent」频道最新
- 开源复刻被封锁的 ComfyUI 提示词节点,Goated Prompter 本地运行 — Jolanoff · 2026-09-25
- 独立开发者做 AI 自动化三年:月入 1100 到 3800 美元到单合同抵过去一月 — Kakachia777 · 2026-09-25
- Solidity 审计 Agent v4 开源,社区移植适配 Vyper 生态 — banteg · 2026-09-25
- 分析 246 个仓库和 57 篇论文:agent harness 什么做法真有效 — Marmelab · 2026-09-25
- Cua 发布 Omarchy 稳定版驱动,系统级多光标操控电脑 — TianbaoX · 2026-09-25
- 开发者求 20 美元档 AI agent 订阅:跑非代码创意项目工作流 — quickprojectmaker · 2026-09-25