Rust 重写推理引擎核心:代码量锐减,启动飞快

charles_irl · x · 2026-08-18

开发者尝试用 Rust 重写推理引擎核心,仅需约 3k 行代码即可处理调度、KV 缓存、前缀缓存和多模态等功能。通过 Codex 辅助实现了 DeepSeekV4 Flash、Gemma 3、GPT-OSS 等模型支持,发现简单模型约需 2.5k 行适配代码,而 DeepSeekV4 Flash 这类复杂模型则高达 7k 行。该方案通过让开发者编写前向传播而非配置大量 CLI 参数,实现了极快的启动速度(无技术债务且仅需单一模型前向传播),未来 SGLang 或 vLLM 可能借鉴此模块化设计。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →