laya.cpp:C++ 实现让 Laya 推理快至 366 题/秒

lkarlslund · reddit · 2026-09-21

社区开发者为开源决策模型 Laya 写了独立 C++ 推理实现 laya.cpp,基于 ggml 加自定义 CUDA 内核,支持英文、多语和 typed-decisions 三个 checkpoint,含原生分词与 JEV 兼容 HTTP 端点,推理无需 Python/PyTorch。- 在限功率 450W 的 RTX PRO 6000 Blackwell 上,BF16 batch 1 达 366 题/秒,是 Python 实现的约 2.5 倍;batch 8 达 810 vs 663- 优化点:去除多余转换与拷贝、在保持舍入前提下融合算子、改进 attention 内存访问- MIT 许可,BF16 需 CUDA 13.0/cuBLAS 13.1.0 构建配置,作者用 Codex Astra 完成

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →