DeepSeek-V4.1-Flash 上线 Fireworks:552B MoE 主打编码与智能体
lqiao · x · 2026-09-11
- Fireworks 宣布上线 DeepSeek-V4.1-Flash,这是一个 552B 参数的多模态 MoE 模型,原生支持图文输入,上下文最长约 100 万 token。
- 据介绍其 Causal Encoder-Decoder 架构在 prefill 时仅激活 8B、decode 时激活 16B 参数,KV cache 占用约为上一代 V4-Flash 的四分之一,定位为编码、网络安全与智能体场景的「主力工作马」。
- Fireworks 宣称其在 DeepSWE、CyberGym、Automation Bench 上优于 Opus 5 与 GPT 5.6 Sol,成本仅约 1/40(此为厂商口径)。定价为输入 $0.22 / 缓存输入 $0.007 / 输出 $0.66 每百万 token,支持 serverless 与按需专卡部署;元数据中显示暂不支持 function calling 与微调。
「Infra」频道最新
- L3Harris:微调开源模型 48 小时内击败前沿 AI,成本低 95% — eliano · 2026-09-11
- Qwen3-TTS 1.7B 在 llama.cpp 上 CPU 实现 1.6 倍实时语音克隆 — alexcovo_eth · 2026-09-11
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11