LithosAI 用 GPU 虚拟化推出多档推理服务,冲击 agent 推理性价比前沿
JiaZhihao · x · 2026-09-25
LithosAI 发文介绍其 agent 推理基础设施思路:与多数厂商只提供单一 API、单一延迟档位不同,它通过 GPU 虚拟化提供多档速度/价格选择。作者称多档位反而提高了 GPU 利用率,并在 Artificial Analysis 的评测中验证了其在 agent 推理速度、延迟与成本上的帕累托前沿表现。
「Infra」频道最新
- Lambda 工程师详解本地推理装机:27B 模型需 24-32GB 显存 — TheZachMueller · 2026-09-25
- Pokee AI 现场演示 36B agent 模型跑在 32GB 内存的骁龙笔记本上 — Kyrannio · 2026-09-25
- AMD 讲师亮相 PyTorchCon:1K+ MI355X 上实现 MXFP8 预训练扩展 — PyTorch · 2026-09-25
- AI 能源公司 Parallax 出炉,获 Founders Fund 领投 1.17 亿美元 — graceisford · 2026-09-25
- Nebius/WEKA 实测:分布式 KV cache 让单节点 agent 推理吞吐提升 2.4 倍 — AccBalanced · 2026-09-25
- Burkov AI 周报 #179:GPU 租买账、llm-d 低成本部署 753B 开源模型 — burkov · 2026-09-25