vLLM 联合 Baseten 上线 Kimi K3 生产级 API
vllm_project · x · 2026-07-30
vLLM 项目官方宣布,Kimi K3 模型现已通过 Baseten 平台提供生产级 API 支持。Baseten 将 vLLM 作为其推理栈的一部分,用户可以直接调用这个拥有 2.8 万亿参数的模型,而无需自行管理底层基础设施。
「Infra」频道最新
- QuixiAI 展示在 AMD MI300X 上运行模型的优化方案:支持 gguf 和自定义 HIP 内核 — QuixiAI · 2026-07-30
- QuixiAI开源SlimServe:基于AMD MI300X加速GLM推理 — QuixiAI · 2026-07-30
- RTX 3090 跑大模型负载时的显存温度探讨 — Whole_Alternative_18 · 2026-07-30
- ICML 2026 Spotlight:ThunderAgent 实现智能体推理 2 倍提速 — togethercompute · 2026-07-30
- Together Compute 发布多节点推理引擎,支持近线性扩展 — togethercompute · 2026-07-30
- DigitalOcean 成为 Kimi K3 首发推理伙伴,支持百万上下文 — vllm_project · 2026-07-30