DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩
ollama · x · 2026-09-11
DeepSeek-V4.1-Flash 现已可在 Ollama 上以云端模式运行。该模型是多模态 MoE,552B 骨干参数(页面标注 763B 总参数),支持最长 100 万 token 上下文,支持 vision、tools 与 thinking。
- 架构上采用 Causal Encoder-Decoder(CED)设计:20 层因果编码器叠加 20 层解码器共 40 层 Transformer,重点创新在 KV cache 压缩,大幅降低长上下文成本。
- 定价:输入 $0.15/1M、缓存命中 $0.003/1M、输出 $0.60/1M。
- 可直接通过 ollama 命令接入 Claude Code、OpenCode 等 agent 工具。
「Infra」频道最新
- 研究实测:26 个 LLM 中转路由恶意注入工具调用并窃取凭证,一名客户钱包被盗 50 万美元 — RexDouglass · 2026-09-11
- Google 宣布在芬兰投资 150 亿美元建设 AI 基础设施 — LinkedInNews · 2026-09-11
- 作者自制 KiCad 封装库,让 AI 芯片 DIY 原型板更好布线 — debreuil · 2026-09-11
- 从业者爆料:LLM 推理服务商毛利极薄,月营收1万美元仅赚200美元 — metalvendetta · 2026-09-11
- kimi k3 或采用同置异步 RL,v4 批次不变性设计引猜测 — stochasticchasm · 2026-09-11
- Peter Diamandis:AI 竞赛正变成我们这代最大的基建工程 — PeterDiamandis · 2026-09-11