Baseten 讲推理优化:团队仍能挤出 20% 到 200% 性能提升
afurgs · x · 2026-08-04
这条内容指向一场关于 推理工程(inference engineering) 的长访谈/课程,围绕 Baseten 展开。
核心信息包括:
- 把训练好的权重变成快、稳、便宜的产品,本身就是一个全新的优化问题
- 推理团队如今仍能找到 20–200% 的性能提升空间
- 量化、speculative decoding、GPU kernel 优化是重点手段
- 视频生成会撞上 二次复杂度的 attention 墙
- 文中还提到,GLM-5.2 似乎帮助重写并优化了服务 GLM-5.2 自己的 GPU kernels
整体上,这是一条把“训练之后怎么把模型高效提供给用户”讲透的基础设施向素材。
所属事件:Baseten团队分享AI推理优化与工程实践(3 条相关)→
「Infra」频道最新
- K3 被低估了,作者主张企业自建推理基础设施 — hsu_byron · 2026-08-04
- Photon 2.0 把 Moondream、Qwen 3.5 编译成 megakernel — sloppenheimer · 2026-08-04
- Minimax H3 可在 3060 12GB 上跑,10 秒视频要 30 分钟 — irmemon225 · 2026-08-04
- Minimax H3 在 5070 Ti 上实测,ComfyUI 对比 Sage Attention 和 Easy Cache — TheRedHairedHero · 2026-08-04
- 开源 H3Zero 把 MiniMax H3 做成了 Modal 托管版 — LegacyV1 · 2026-08-04
- MiniMax H3 已能做 15 秒视频,但一张 5090 要跑 6 分钟 — Careless-Constant-33 · 2026-08-04