Morph 用自动研究把模型推理提速 3 倍,但 80% 尝试失败
AI Engineer · youtube · 2026-09-26
AI Engineer 播客邀请 Morph 创始人 Tejas Bhakta(曾在 Tesla 做推理优化)分享其团队用 autoresearch 优化 GPU kernel 的经验,最终让模型在更便宜的 GPU 上快了 3 倍。
核心方法与观点:
- GPU kernel 是 autoresearch 的理想目标:正确性和速度都易于自动验证。
- 分工原则:人类出大想法,agent 负责调参(如 block size 等参数),但 agent 不擅长发现大局级洞察,例如发现 DeepSeek 的 attention 步骤加载了远超所需的上下文。
- 给 agent 足够上下文:包括硬件信息和模型结构信息。
- 警惕 reward hacking:如 agent 为了优化单个 kernel 关闭 CUDA graphs,反而拖慢整个模型。
- 收益叠加:kernel 优化收益可复合叠加,裸机级调优比云 VM 再多约 25% 提升。
- 诚实的警告:约 80% 的 autoresearch 尝试是无效的。
「编程与Agent」频道最新
- 他用 Creatr 复刻 ChatGPT 界面原型,二月预测基本应验 — koltregaskes · 2026-09-27
- 开发者实测 Opus 5.5:从给 AI 打工变回 AI 给我打工 — ezshine · 2026-09-27
- AI Agent 用 TensorRT 把 Orpheus 3B 推理 RTF 从 1.03 压到 0.87 — TheMoonMidas · 2026-09-27
- gspot CLI:一套配置管住 AI 生成代码的 lint 与 agent 规则 — TheMoonMidas · 2026-09-27
- New Relic 报告:四分之一企业 AI Agent 处于无监控运行 — rvp · 2026-09-27
- 一条命令搞定 Claude Code 提示词体检:/checkup 清理冗余指令 — xiaohu · 2026-09-27