laya.cpp:C++ 实现让 Laya 推理快至 366 题/秒
lkarlslund · reddit · 2026-09-21
社区开发者为开源决策模型 Laya 写了独立 C++ 推理实现 laya.cpp,基于 ggml 加自定义 CUDA 内核,支持英文、多语和 typed-decisions 三个 checkpoint,含原生分词与 JEV 兼容 HTTP 端点,推理无需 Python/PyTorch。- 在限功率 450W 的 RTX PRO 6000 Blackwell 上,BF16 batch 1 达 366 题/秒,是 Python 实现的约 2.5 倍;batch 8 达 810 vs 663- 优化点:去除多余转换与拷贝、在保持舍入前提下融合算子、改进 attention 内存访问- MIT 许可,BF16 需 CUDA 13.0/cuBLAS 13.1.0 构建配置,作者用 Codex Astra 完成
「Infra」频道最新
- Intel CEO 坦言:服务器 CPU 只能满足约一半客户需求 — Beth_Kindig · 2026-09-21
- 实测 exllamav3 3bpw 跑 Flash:单张 5090 达 1500 prefill/29 tps — youcloudsofdoom · 2026-09-21
- SGLang 打补丁跑通 MCP,计算机操作与浏览器智能体可用 — TheZachMueller · 2026-09-21
- 华为发布 Ascend 960 超节点:4096 卡 8 EFLOPS,2027 Q3 交付 — teortaxesTex · 2026-09-21
- Vercel 上中国模型 token 份额三个月涨约 5 倍 — menhguin · 2026-09-21
- 四张 Intel B70 还是 128GB MacBook?本地大模型硬件求助 — Rokett · 2026-09-21