LLM 能写多 GPU 内核吗?Together AI 揭示算力瓶颈新解
AI Engineer · youtube · 2026-08-28
NVIDIA B200 相比 A100 算力提升 7.2 倍,但互联仅提升 3 倍,导致瓶颈从 GPU 转移到互联链路。Together AI 提出 ParallelKittens,通过少量代码改进实现计算与通信重叠。实测 ParallelKernelBench 显示,最强前沿模型零样本解决 28 个问题,31% 能超越基线。Agent 模式可将正确率提升至 35%,但在集体排序、数据分区等逻辑上仍存在局限。
「Infra」频道最新
- 手把手:用 Terraform 与 GitHub Actions 将 Agent 部署至 AWS ECS — kmeanskaran · 2026-08-28
- AMD ROCm 10.0.0 发布:扩展支持矩阵并简化安装流程 — AnushElangovan · 2026-08-28
- llama.cpp 合并 DFlash2 支持:本地卷积加候选选择器 — DjCanalex · 2026-08-28
- Gemma 4 MLX 挑战赛启动,Mac 端性能提升 8% — gajesh · 2026-08-28
- llama.cpp 合入 DFlash2:局部卷积+候选选择器上本地推理 — jacek2023 · 2026-08-28
- Google 探讨无状态 MCP,助 Agent 工具弹性伸缩 — rseroter · 2026-08-28