Modular 首席科学家:Mojo 内核称超 FlashAttention 4,MAX 推理跨全硬件
AI Engineer · youtube · 2026-10-12
AI Engineer World's Fair 2026 上,Modular 首席科学家 Abdul Dakkak 讲述为何要重建 AI 软件栈:算力被订满数年、新芯片不断涌现,而 vLLM、SGLang、TensorRT-LLM、llama.cpp 各自为不同硬件打补丁,栈已一片混乱。
三大组件
- Mojo:Pythonic 系统语言,面向 CPU、GPU 与各类加速器,目标是对齐 CUDA 性能;已开源 matmul、attention 等内核,Dakkak 称其超过厂商库和 FlashAttention 4;Mojo 1.0 及开源版 Mojo 即将到来
- MAX:重新思考 PyTorch 时代假设的推理框架,以 OpenAI 兼容端点支持数千种模型架构,可跨 GPU、多节点乃至混合硬件运行
- Modular Cloud:把三者串成「可调的玻璃箱」
实测数据:分享了对 Kimi K2.5、FLUX.2、AMD MI355、Gemma 4 的基准对比(vs vLLM、torch.compile),并演示亚秒级图像生成。可通过 pip install modular 上手。
「Infra」频道最新
- 456GB 大模型塞进 192GB 显存:混合 offload 推理实测跑通 — HankYeomans · 2026-10-12
- VitalOps 上线:智能体自动优化推理栈,实测提速 2.6 倍 — abhijithneil · 2026-10-12
- AMD 7900 XTX 本地跑 Qwen3.8 Flash-Next:500k 上下文 105-160 tok/s — human_in_the_looop · 2026-10-12
- 西门子将 Nvidia Omniverse 引入数字孪生工具,铺路工业 Physical AI — RevLebaredian · 2026-10-12
- OpenRouter 月 token 流量 18 个月从 2T 暴增至 379T,开源模型占 75% — Beth_Kindig · 2026-10-12
- 求助:2x3060 上 llama.cpp 跑 Qwen3.8-Flash-Next 仅 15 tok/s — Dreeew84 · 2026-10-12