LLM 能写多 GPU 内核吗?Together AI 揭示算力瓶颈新解

AI Engineer · youtube · 2026-08-28

NVIDIA B200 相比 A100 算力提升 7.2 倍,但互联仅提升 3 倍,导致瓶颈从 GPU 转移到互联链路。Together AI 提出 ParallelKittens,通过少量代码改进实现计算与通信重叠。实测 ParallelKernelBench 显示,最强前沿模型零样本解决 28 个问题,31% 能超越基线。Agent 模式可将正确率提升至 35%,但在集体排序、数据分区等逻辑上仍存在局限。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →