Ramp 实测 Jev 替代 LLM 重排:尾延迟降 10 倍至 300ms、成本省 3 倍
multiply_matrix · x · 2026-09-25
Ramp 的 Ashwin 在其会计产品中把 Jev 作为基于 LLM 的 reranking 替代方案做了基准测试,结果非常亮眼:在 GPT-5.6 Luna 上保持同等准确率的同时,尾延迟从原来的水平下降 10 倍至 300ms,成本降低 3 倍。团队表示将尽快把这一方案推向 7 万名生产用户,目前唯一的阻碍是遇到速率限制。这条实测为推理成本与延迟优化提供了一个真实生产环境的参照案例。
「Infra」频道最新
- 免校准量化方法 TQ 开源:4-bit 量化 Qwen3.8-27B 即发即用 — textclf · 2026-09-25
- Ben Bajarin:Agent 推理重塑数据中心 CPU/GPU 配比,neocloud 落后 hyperscaler — BenBajarin · 2026-09-25
- PreFT 论文入选 NeurIPS:仅 Prefill 阶段用 LoRA,多适配器推理提速 — aryaman2020 · 2026-09-25
- 网友晒 32 GPU 本地 AI 主板,评论区想塞进自家壁橱 — TheZachMueller · 2026-09-25
- 《现代微处理器 90 分钟指南》:系统/性能工程师的速成经典 — blaizedsouza · 2026-09-25
- GPU 成新资产类别:H100 一年回报 +76%,B300 租金指数涨 66% — KyeGomezB · 2026-09-25