如何从零推导出 Embedding:把检索扩展到大集合你就懂了
antoine_chaffin · x · 2026-09-29
antoinechaffin 用一条思想实验解释 embedding 的由来:如果你尝试把「Jev retrieval」式的检索扩展到真正大规模的集合上,就会发现必须先对集合做预过滤,把检索范围缩小到一个小子集,且这个预过滤步骤必须能用亚线性成本廉价跑完。做完这一步,你就等于从第一性原理重新发明了 embeddings。帖子以反讽口吻指出,语义向量检索并非玄学,而是大规模检索下的必然工程选择。
「研究」频道最新
- AI 智能体给出 Collatz 猜想新进展:正比例整数回于 1 并完成 Lean 形式化 — AlexKontorovich · 2026-09-29
- 意外发现:平均 OCR 注意力头可得高质量可解释性透镜 — benno_krojer · 2026-09-29
- 接触密集型机器人 RL 论文获 IROS workshop 最佳学生论文奖 — GeorgiaChal · 2026-09-29
- saezlab 开源 mc-ASTRA:跨患者与时间点研究组织重塑的 Python 框架 — anshulkundaje · 2026-09-29
- SK 模型采样难题突破:多项式时间算法覆盖 β<1 全区间 — canondetortugas · 2026-09-29
- 实测 Jev 跑推理密集型回归任务:快但准头一般 — dbreunig · 2026-09-29