CEA编码器解码器分离架构或改变GPU池化与异构推理方式
metmelo · reddit · 2026-09-10
有用户提出,CEA 架构不只是效率优化,更像是推理架构层面的变化。编码器/解码器分离带来一个关键含义:不必再把所有 GPU 一视同仁,可以让 prefill 专用 GPU 跑编码器、decode 专用 GPU 跑解码器,各自针对推理的不同阶段优化。
也可以采用异构方案,用较新的 GPU 做 prefill、用旧 HBM 卡做 decode。作者表示 4.1 Flash 显然跑不动自己的 4×MI50 + 2×V620 配置,但如果 Qwen 在新 Flash 模型中采用该架构会非常期待。
「Infra」频道最新
- 一张图讲透微服务 12 种核心通信模式与适用场景 — goyalshaliniuk · 2026-09-10
- MIT Tech Review:AI 断电是架构问题,中压 UPS 或成解药 — nordicinst · 2026-09-10
- 开源 iOS 应用 Pocket AI Lab:三后端在 iPhone 本地跑 LLM — Ammoryyy · 2026-09-10
- AI 数据中心秒级甩 3GW 负载,MIT Tech Review 称供电是架构问题 — MIT Tech Review AI · 2026-09-10
- Triton 作者 Phil Tillet 谈 Gluon:让 AI 自己决策 GPU 编程 — TheTuringPost · 2026-09-10
- DeepSeek 开源 deepseek-recipe,简化 V4.1 Flash 部署 — teortaxesTex · 2026-09-10