流式输出如何拦截禁用短语:连续批处理服务器请求回退实现详解
AlpinDale · x · 2026-09-08
AlpinDale 发布博文,讲解在连续批处理(continuously batched)的 LLM 推理服务器中,如何禁止模型输出特定完整短语。
- 难点:短语不等于 token。按 token 粒度禁用 blast radius 太大(比如禁 test 会误伤 testament);而流式输出下,引擎识别出完整短语时部分 token 可能已经推到用户屏幕上,且 KV cache 已更新,简单删文本无法清除模型历史。
- 思路:对可能补全成禁用短语的输出先行扣留(hold back),一旦匹配命中,就把该请求「回退」(rewind)并重新采样另一条继续路径。
- 实现:在异步调度器里做这件事比离线 serving 复杂,因为 worker 可能已经在处理后续 step。作者在 Sonar(前 Aphrodite Engine)中完成实现;类似机制在 ExLlamaV3、KoboldCpp、AntiSlop Sampler 中已有雏形。
「Infra」频道最新
- M.2-Oculink 显卡链路暗降 PCIe 1x,附 lspci 排查命令 — El_90 · 2026-09-11
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 8GB 显存还能干嘛?网友求解小模型现状与推荐 — riceinmybelly · 2026-09-11
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- Draghi 引用 ECB 研究:AI 或每年提振欧洲生产率 0.3-0.4 个百分点 — rohanpaul_ai · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11