Perplexity 新上下文嵌入模型登顶 context-bench,召回率提升 50%+
marktenenholtz · x · 2026-10-01
向量搜索公司 turbopuffer 公布其内部上下文嵌入基准 context-bench 的最新结果:Perplexity 的新模型登顶榜首,文档召回率@10 较传统 SOTA 嵌入模型提升超过 50%。marktenenholtz 转发并以「Are you entertained?」调侃这一结果。turbopuffer 表示该基准用于指导客户选择搜索相关性更优的方案。
「模型」频道最新
- 被指刻意回避:Google 基准表遗漏 Sol、Opus 与 Fable 引发质疑 — zacharynado · 2026-10-01
- TheZvi 调侃:好奇心驱动,想偷看 Gemini 4 Argon 表面之下的东西 — TheZvi · 2026-10-01
- DeepSWE v1.1 长程编程评测:Gemini 4 领先 Opus 5.5 与 GPT-6 — rohanpaul_ai · 2026-10-01
- DeepMind 研究员祝贺 Google:Argon 表现亮眼,重返前沿 — andrew_n_carr · 2026-10-01
- GDP.xlsx 基准发布:70 个真实表格任务,最强 agent 仅得 38.3% — echen · 2026-10-01
- Gemini 4 Argon 优化量子计算子程序,几分钟内超已发表基线 40% — LinusEkenstam · 2026-10-01