LithosAI 推出 Kimi K3,推理速度达 800 tokens/秒
Tim_Dettmers · x · 2026-08-20
LithosAI 发布了首个定价层级和 API,主打极致的智能体推理速度。其 Kimi K3 模型在标准 GPU 上实现了每用户 800+ tokens/秒的推理速度,同时保持完整模型质量,声称比主流提供商快 16 倍。
核心特点:
- 极致速度:在单节点 8×B300 上实测达到 800+ tokens/秒/用户。
- Agent 优化:针对包含规划、工具调用、观察、重试的 Agent 循环进行了低延迟优化。
- 兼容性强:提供 OpenAI 和 Anthropic 兼容的 API,支持 Claude Code、Codex 等多种 Agent 框架,仅修改一行 URL 即可接入。
- 支持模型:除 Kimi K3 外,还支持 GLM 5.3、Qwen 3.8、DeepSeek V4 等。
所属事件:LithosAI 推出 Kimi K3,推理速度超 800 tokens 每秒(3 条相关)→
「Infra」频道最新
- 英伟达发布 CUDA-Q Algorithms,构建容错量子计算原语库 — tomaszbednarz · 2026-08-20
- Dolphin Network 推出 GPU 闲置算力 P2P 推理网络 — toptickcrypto · 2026-08-20
- Epoch 估算:OpenAI 约 1.2%~2.4% 算力用于安全监控 — sjgadler · 2026-08-20
- 观点:Cerebras 极速推理或让 OpenAI 的研发闭环快 20 倍 — Scobleizer · 2026-08-20
- AI 智能体不是微服务,架构需引入持久执行层 — rseroter · 2026-08-20
- 实战:利用本地 Apple 模型优化产品个性化体验 — signulll · 2026-08-20