没有评估就是盲建:上下文嵌入模型需对消歧上下文块也高排序
antoine_chaffin · x · 2026-10-01
Antoine Chaffin 强调评估的重要性:没有评估就是在盲建,做好评估很难,需要大量努力才能摆脱常见偏差、评估新能力。与 @n0riskn0r3ward 的讨论让他们重新审视模型和方法中哪些有效、哪些无效,认为长期看值得投入。
被引用的 @n0riskn0r3ward 分享了上下文嵌入模型的使用心得:自 voyage-context-3 发布后开始使用并做基准测试,发现对长文档而言,不仅要对答案块高排序,还要对消歧上下文块高排序。做得好可让搜索 agent 只读文档相关部分而非每一页。他因此开始测量这一点,并主动向 Perplexity 团队分享基准结果——并非所有建模团队都愿意接受第三方反馈,但 Perplexity 团队很积极。
「编程与Agent」频道最新
- Jevathon 上的 AI 乐队:Jev 不弹音符只做指挥,每小节省 2.7 秒 — schwentker · 2026-10-01
- OpenAI 推 Decisions API 被指神似 Jev,7 支黑客松队伍提前撞车 — schwentker · 2026-10-01
- 如何提出让人愿意回答的问题:三行以内、直奔主题 — jackedAJ · 2026-10-01
- 训练工程师:自己写 bs=1 trainer 比向 LLM 解释怎么写容易 — cephaloform · 2026-10-01
- 从编排多个 Codex 线程到直接问一个 agent,工作流悄然简化 — gabrielchua · 2026-10-01
- Private AI Proxy 上线 Mac:用硬件证明保护 Agent 代码隐私 — bgmshana · 2026-10-01