实测证明 RAG 分不清反义句,好模型不可替代

galratner · reddit · 2026-09-25

作者用 nomic-embed-text 嵌入两句退款政策,问「婚礼取消能否退款」:说不退款的句子反而相似度最高(0.7260 vs 0.7216),五种问法下两句差距不超过 0.02。结论:嵌入编码的是「文本讲什么主题」,是/否这种关键细节基本丢失;且向量搜索没有「无匹配」概念,问能否带狗时距离截断也拦不住内容相反的句子。

引用 Stanford/Yale 团队对 Lexis+ AI 与 Westlaw AI 的 202 个预注册法律查询测试:Lexis 幻觉率超 1/6,Westlaw 达 1/3,其中 61% 的幻觉答案源于推理错误——检索结果往往看起来很相关。

作者运营一个拉斯维加斯婚礼策划生产级 agent(Claude Opus + .NET 10 MCP 连接器直连订位系统,API 过载时回退 Sonnet),核心观点:检索决定模型看到什么,权重决定模型怎么处理——发现矛盾、判断新政策覆盖旧政策、对没数据的问题如实说不知道,这些都靠模型而非 RAG。文末求证 reranker 能否可靠区分此类矛盾。附可复现代码(C#、TextSearchProvider、SQL Server 2025 向量、DiskANN 索引只读坑)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →