传 Kimi K3 达 2.8T 参数,27B 密集模型其实不算小

Xianbao_QIAN · x · 2026-08-16

XianbaoQIAN 整理了一份未经证实的国产下一代模型参数对比(总参数/激活参数):

按计算量看,传闻的 Qwen 3.8 27B 密集模型比 DeepSeek V4 Flash 更重、与 MiniMax M3 相当。作者强调 27B 并不是小模型,但如今已能在消费级硬件上本地运行——这要归功于近几年的硬件与基础设施进步。

被引的 @dashenwang 长文解释了 27B 的「含金量」:Google 训练 Gemma 3 27B 用了 14 万亿 Token、6144 颗 TPU v5p;仅推理侧,BF16 原始权重约 54GB,32K 上下文加 KV Cache 约需 72.7GB 内存;训练时还要额外装下梯度、优化器状态、激活值和各类通信 buffer。14 万亿 Token 若按一人每天读 10 万 Token 且不休息,读完需约 38 万年。

所以本地能跑 27B 甚至 70B,并不是因为家用电脑能训练它们,而是量化与优化把一个需要数千颗 AI 芯片训练出来的模型塞进了桌子下的小电脑——「这个过程本身就挺赛博朋克的」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →