用 LLM 做可解释嵌入:给每个维度起名字,替代 1536 维黑盒向量

kieranklaassen · x · 2026-09-26

作者分享一个实用技巧:不用传统 embedding 模型输出 1536 个无意义的数字,而是用 LLM(他用的 Jev)针对每篇文档回答一组预设问题,把答案作为向量维度。

例如收件箱里的邮件可表示为 [是客户, 紧急, 关于账单, 需回复] → [1.0, 0.9, 1.0, 1.0];新闻信、朋友约午饭则各维度接近 0。之后直接用传统余弦相似度检索:搜「客户账单问题」即查 [1, 0.5, 1, 0.5],重复扣费的邮件自然排最前。

关键优势:每个数字都有名字,能看出匹配原因;要新维度就加一个问题,想优先紧急事项就调查询向量。作者正把它用到 Cora 的邮件搜索和 Every 的文章分类、工单分类([是bug, 愤怒, 流失风险, 企业])等场景。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →