Truespar发布Paddock:专为NVIDIA优化的本地LLM推理引擎
wandedob · x · 2026-08-06
Truespar 推出了名为 Paddock 的本地大模型推理引擎(研究预览版),专为 NVIDIA 显卡优化,支持 Windows 和 Linux。
核心特性与性能:
- 高并发处理:支持连续批处理、分块预填充和分页 KV 缓存,能很好地应对 Agent 的高并发请求。
- 极简部署:单文件可执行,无需配置 Python/PyTorch 或对齐 CUDA 版本,数据完全本地化。
- 性能对比:在相同硬件和权重下,Paddock 在 11/13 项场景中快于 vLLM(最高快 76%),在所有场景中快于 SGLang(1.66x-2.91x)和 llama.cpp(1.12x-7.2x)。
「Infra」频道最新
- B300 算力价格创历史新高,Neocloud 集体转向推理 — rickasaurus · 2026-08-07
- 马斯克:芯片产能成 AI 发展瓶颈,TerraFab 直击痛点 — XFreeze · 2026-08-07
- YC S26新项目Understudy:通过蒸馏小模型帮企业省80% Anthropic账单 — ycombinator · 2026-08-07
- 单次AI提问耗电仅0.3瓦时?智能体能耗飙升600倍 — tobyordoxford · 2026-08-06
- Sam Altman 投资的 Oklo 小型核反应堆不到一年实现临界 — TinfoilTricorn · 2026-08-06
- 求助:如何将 MiniMax H3 优化栈移植到单卡 RTX 5090? — cat_trick · 2026-08-06