用 LLM 做可解释嵌入:给每个维度起名字,替代 1536 维黑盒向量
kieranklaassen · x · 2026-09-26
作者分享一个实用技巧:不用传统 embedding 模型输出 1536 个无意义的数字,而是用 LLM(他用的 Jev)针对每篇文档回答一组预设问题,把答案作为向量维度。
例如收件箱里的邮件可表示为 [是客户, 紧急, 关于账单, 需回复] → [1.0, 0.9, 1.0, 1.0];新闻信、朋友约午饭则各维度接近 0。之后直接用传统余弦相似度检索:搜「客户账单问题」即查 [1, 0.5, 1, 0.5],重复扣费的邮件自然排最前。
关键优势:每个数字都有名字,能看出匹配原因;要新维度就加一个问题,想优先紧急事项就调查询向量。作者正把它用到 Cora 的邮件搜索和 Every 的文章分类、工单分类([是bug, 愤怒, 流失风险, 企业])等场景。
「编程与Agent」频道最新
- Datasette 1.0a40 修复表名换行符绕过权限泄露私有数据漏洞 — JeremyCMorgan · 2026-09-26
- Hamel Husain:让 AI 输出更易评估,先改产品设计而非堆评测 — HamelHusain · 2026-09-26
- Exa 发布 Agent Ultra:智能体蜂群深研自称全面 SOTA — yoimnotkesku · 2026-09-26
- YC 转发 Greptile 新档位:把更多算力花在验证而非生成上 — ycombinator · 2026-09-26
- OpenAI 官方晒案例:Proaction 用 GPT-6 Astra 加速车队管理 Agent 开发 — OpenAIDevs · 2026-09-26
- 一句话提示词直出宣传视频:关键在「每帧固定算出、结果完全一致」 — ezshine · 2026-09-26