jinfer 开源:纯 JVM 实现 AI 推理引擎,CPU 性能比肩 llama.cpp
mukel90 · reddit · 2026-09-15
开发者 mukel90(此前写过 llama3.java、gemma4.java)发布开源项目 jinfer:一个从第一性原理为 JVM 构建的 AI 推理引擎,支持聊天、视觉、音频转写、embeddings、reranking 和 TTS,无需 Python 运行时、ONNX 或 sidecar 进程。
项目组成:
- jinfer:JVM 推理引擎,支持多种主流模型与模态
- toknroll:纯 Java、零依赖的高速 LLM tokenizer
- 原生读写 gguf / safetensors 两大模型格式
- jam:量化矩阵乘法例程(Vector API + 可选原生后端),CPU 上性能与 llama.cpp 相当
- jota:面向 Java、C、CUDA、HIP、Metal、OpenCL、Mojo 的张量 API
集成 Spring AI 与 LangChain4j,一等支持 GraalVM Native Image。现状:早期版本,目前以 CPU 为主要目标,GPU 支持开发中。Apache 2.0 协议开源。
「Infra」频道最新
- Baseten 优化 Nemotron 3 Ultra 推理,B200 四卡并发用户提升 2.5 倍 — baseten · 2026-09-15
- 单卡 5090 跑 Qwen3.8-27B:SGLang 全参数调优只换来 82k 上下文 — ni1by2thetrue · 2026-09-15
- 把 4 块 MCU 开发板搬上网:AI 写完固件即时上真芯片测试 — SelfishlyWandering · 2026-09-15
- Grouped Value Attention 分组存值按需重建 Key,压缩 KV Cache — Vishesh Tripathi · 2026-09-15
- Wan 2.2 显存实测:砍帧数不降 OOM,降分辨率一次省 10GB — Realistic-Fennel-190 · 2026-09-15
- 无状态故障转移丢失近 100% 上下文,ContinuityBench 提出 99.2% 保持率方案 — its_vayishu · 2026-09-15