Akamai 工作坊:用 vLLM 实测让 Agent 拥有自己的推理栈
AI Engineer · youtube · 2026-10-11
AI Engineer 频道发布 Akamai 的 Du'an Lightfoot 与 Khaja Omer 的推理工作坊视频,核心主张是 Agent 应「拥有自己的推理」——即掌握自托管推理而非只调 API。
- 开篇案例:speculative decoding 反而把 demo 模型从约 58 tokens/s 降到 16 tokens/s,说明更快的推理配置必须针对具体模型、硬件和工作负载来衡量。
- 工作坊内容:提供 Kubernetes 环境含 Jupyter notebook 与 vLLM 端点,以 Qwen 为示例模型。内容覆盖:hosted API vs 专用 GPU 的选型决策;流式 token 延迟测量;权重体积、带宽与 KV cache 容量的内存预算;prefill/decode 与冷热前缀缓存;dense 模型与 MoE 对比。
- 优化实战:Omer 将部署切换为 FP8 模型后重跑负载测试并做输出质量抽查;当 speculative decoding 拖慢性能时,排查接受率、模型兼容性与 GPU 争用后回退基线;最后调并发找到吞吐趋平而延迟上升的临界点。
- 可复用方法论:建立基线 → 改一个 serving 参数 → 重跑真实负载测试 → 速度与质量并评。
「编程与Agent」频道最新
- shadcn 自述:为组件打磨数周抽象,AI 尚未加速设计只能加速试错 — shadcn · 2026-10-11
- 7 周生产级 Agentic RAG 免费课程开源,GitHub 已收获 9.7k 星 — mdancho84 · 2026-10-11
- 内部人士爆料:训练中的智能体集群只给 shell 权限和 30 分钟倒计时 — cephaloform · 2026-10-11
- 重度用户实测:让 AI 编码智能体 24/7 跑活,周额度两天耗尽 — gandamu_ml · 2026-10-11
- 上线前6天发现代码里模型名是AI幻觉编造的,130个测试全没拦住 — Trout_dev · 2026-10-11
- DeepMind研究员:用computer use代理1小时完成个人设备安全审计 — SamuelAlbanie · 2026-10-11