Modular 首席科学家:Mojo 内核称超 FlashAttention 4,MAX 推理跨全硬件

AI Engineer · youtube · 2026-10-12

AI Engineer World's Fair 2026 上,Modular 首席科学家 Abdul Dakkak 讲述为何要重建 AI 软件栈:算力被订满数年、新芯片不断涌现,而 vLLM、SGLang、TensorRT-LLM、llama.cpp 各自为不同硬件打补丁,栈已一片混乱。

三大组件

实测数据:分享了对 Kimi K2.5、FLUX.2、AMD MI355、Gemma 4 的基准对比(vs vLLM、torch.compile),并演示亚秒级图像生成。可通过 pip install modular 上手。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →