六大效率突破叠加,实验室内部也没料到半导体需求会这样
bookwormengr · x · 2026-09-16
一位工程师梳理了 AI Lab 内部人士普遍没预见到的六大效率趋势:
- 4-hi HBM(WideEP + 更小 batch 带来的等效 HBM 用量下降)
- LPDDR 方案让 HBM 内参数量与 FLOPs 各减约 50%
- 混合线性注意力与稀疏注意力效果远超预期
- Flash 类模型不仅擅长编码,在其他高经济价值任务上同样出色
- Attention Residue、mHC、稳定 MoE 等技术在固定参数量下塞进更密的智能
- encoder-decoder 路线实现约 400 倍 KV cache 压缩而质量几乎无损
由此他指出对半导体需求影响巨大:多数实验室的人此前默认模型规模按 1-3-5-10-30-50-100T 近线性增长,但现实并非如此,而多数长期协议(LTA)正是基于这种旧假设签的。
「Infra」频道最新
- SentencePiece Lite 发布:50KB 二进制,tokenization 快 20-30 倍 — heiga_zen · 2026-09-16
- 华为内部万字备忘录泄露:押注昇腾950替代英伟达,不做基础模型 — pstAsiatech · 2026-09-16
- Qwen 27B 与 DeepSeek v4 Flash 同机异构运行,展示 GPU+统一内存方案 — samsja19 · 2026-09-16
- JPMorgan 预测 2028 年 GPU/ASIC 出货超 2500 万,ASIC 主导增长 — bookwormengr · 2026-09-16
- iamtrask:终局不是单个 AGI,而是人人运行小型 LLM 的信任网络 — iamtrask · 2026-09-16
- Program-as-Weights:0.6B 模型跑赢 32B 直接提示,内存仅 1/50 — yuntiandeng · 2026-09-16