GPU 大部分算力耗在等内存,Agent 任务时长每 4 个月翻倍
alex_verem · x · 2026-10-07
作者引述 Ben Horowitz 本周观点与多方数据,称 AI 行业建立在错误的基础设施之上:
- 聊天机器人场景下 GPU 仅有 5%-15% 的时间在真正计算,其余都在等内存,推理瓶颈在存储带宽而非算力。
- Nvidia 以 200 亿美元收购 Groq 芯片(资产),正是看中这一点。
- 引用 Epoch AI 数据:AI agent 能完成的任务时长每 4 个月翻一倍,而现有系统是为毫秒级请求设计的,错配加剧。
核心论点:面向毫秒请求的旧基础设施无法支撑长时运行的 agent 负载,行业需要为 agent 时代重建推理栈。
所属事件:GPU 大量时间在等内存,巨头押注重建 AI 基础设施(2 条相关)→
「Infra」频道最新
- 5060 Ti 16GB 跑 Qwen3.8 Flash Next IQ1_M:55 tok/s 还能写出像样落地页 — bobaburger · 2026-10-07
- EmbeddingGemma 2 手机端离线跑多模态 RAG,文本仅占 191MB 内存 — Saboo_Shubham_ · 2026-10-07
- 16GB RTX 5080 跑 Qwen 3.8 27B:NInfer 调优后解码 96 t/s、11 万上下文 — Kernoriordan · 2026-10-07
- OpenAI 出资赞助 Rust 编译器提速,Nicholas Nethercote 领衔 — charliermarsh · 2026-10-07
- Google 签 20 年核电购电协议:3590 MW,投资超 43 亿美元 — demian_ai · 2026-10-07
- 实测 NVIDIA Vera CPU:27.4 秒拉起 2000 个沙盒,快到离谱 — mattturck · 2026-10-07