Rust 重写推理引擎核心:代码量锐减,启动飞快
charles_irl · x · 2026-08-18
开发者尝试用 Rust 重写推理引擎核心,仅需约 3k 行代码即可处理调度、KV 缓存、前缀缓存和多模态等功能。通过 Codex 辅助实现了 DeepSeekV4 Flash、Gemma 3、GPT-OSS 等模型支持,发现简单模型约需 2.5k 行适配代码,而 DeepSeekV4 Flash 这类复杂模型则高达 7k 行。该方案通过让开发者编写前向传播而非配置大量 CLI 参数,实现了极快的启动速度(无技术债务且仅需单一模型前向传播),未来 SGLang 或 vLLM 可能借鉴此模块化设计。
「Infra」频道最新
- Brex 榜单:今年增长最快的初创公司超半数做 AI 基建 — mattturck · 2026-08-18
- Falcata:CUDA原生重写GBDT训练循环,比LightGBM快14倍 — srchvrs · 2026-08-18
- Brex 数据:25 家增长最快厂商中过半卖铲子 — AccBalanced · 2026-08-18
- NVIDIA 优化:本地微调性能提升 20% — danielhanchen · 2026-08-18
- 文本水印检测无需重跑 LLM,仅需低分函数计算 — rasbt · 2026-08-18
- 实用指南:各类 AI 模型的量化位数建议 — Memestonks2020 · 2026-08-18