SGLang 推出 /v1/score 与多候选评分,16 候选 p95 降至 20.6ms
hsu_byron · x · 2026-09-26
LMSYS 发布新博客,介绍用 SGLang 扩展 JEV 类决策模型的方案。决策模型(分类、排序、agent 动作选择)需要的是分数而非散文,但用 Generate + top-k logprobs 服务这类模型有两个问题:所需标签可能落在 top-k 之外,且共享前缀被每个候选重复计算。SGLang 的解法:
- /v1/score 接口直接返回指定标签(Yes/No、A/B/C)的分数
- 多候选评分(MIS)只计算一次共享上下文,各候选保持隔离
- MIS 延迟从 2 到 16 个候选几乎持平,Qwen3-8B 上 16 候选 p95 从 54.1ms 降到 20.6ms
- Qwen3-0.6B 上负载升高时 MIS p95 保持在约 100ms 以内,而 Generate 和单候选评分需数秒
该功能由 LinkedIn 团队贡献。
「编程与Agent」频道最新
- 用 Claude Opus 5.5 一次生成 promo 视频,开发者称视频动画已被解决 — JosephJacks_ · 2026-09-26
- dhh 用 Opus 5.5 一次将 Rust 移植为 x86-64 汇编,快 17 倍 — zack_overflow · 2026-09-26
- Anthropic 发文谈递归自我改进:工程师代码产出已增 8 倍 — dlwh · 2026-09-26
- 做了一款字体,让你看到 AI 输出的真实书写格式 — amplifiedamp · 2026-09-26
- Only Then Labs 构想带出处的 agent 记忆授权层 — tallmetommy · 2026-09-26
- Agent 最大瓶颈不是想象力而是成本:动辄数千美元 token 开销 — adam_dorr · 2026-09-26