124M 小模型配 65B embedding,研究员戏谑提出 AFED 分离架构

YouJiacheng · x · 2026-09-29

研究员 YouJiacheng 转发了一条「124M 模型用了 65B embedding」的帖子,戏称:如果要继续 scale,我们需要 AFED——Attention、FFN、Embedding 分离(disaggregation)。

这是对当前推理架构分离趋势(如 PD 分离、KV cache 分层)的调侃式延伸:极端超大 embedding 的用法若成主流,embedding 层或需要独立部署与扩展。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →