YC 系 Prism 推出开源 LLM 推理云,DeepSeek V4.1 Flash 达 547 tok/s
ycombinator · x · 2026-09-25
YC 支持的初创公司 Prism 发布同名推理云服务,主打用 agent 自动优化开源模型部署的成本、延迟与吞吐。
- 提供 DeepSeek-V4.1-Flash(552B MoE,1M 上下文)、GLM-5.3(744B MoE)、Kimi K3、Qwen3.8(2.4T MoE,95B 激活)、Qwen3.6(35B-A3B)等模型,API 兼容 OpenAI 与 Anthropic 格式
- 称以自研 Prism Engine 服务 DeepSeek V4.1 Flash 可达约 547 tok/s,比主流供应商快最高 5.8 倍
- 定位为面向 agent 工作负载的 serverless 推理,无需自管基础设施
「Infra」频道最新
- 曝谷歌下周用猎鹰9号送TPU上天,测试轨道AI数据中心 — McDonaghMatthew · 2026-09-25
- NVIDIA 登顶美国企业市值榜,十年走势图引人注目 — lemire · 2026-09-25
- LithosAI 用 GPU 虚拟化推出多档推理服务,冲击 agent 推理性价比前沿 — JiaZhihao · 2026-09-25
- 模拟芯片跑注意力快 H100 百倍、省电七万倍,Nature 论文挑战冯·诺依曼架构 — anselm · 2026-09-25
- 医疗 AI 的 GPU 调度难题:临床推理要低延迟,科研任务要高吞吐 — Arindam_1729 · 2026-09-25
- 开源 LexiPanel:单面板管理本地 GPU 上的聊天/图像/语音 AI — W61k3r · 2026-09-25