DeepSeek V4.1 Flash 上线 Together AI,性能超 GPT-5.6 Sol 成本仅三分之一

Together AI 宣布上线 DeepSeek V4.1 Flash。该模型为多模态 MoE 架构,采用 Causal Encoder-Decoder,由 552B 主干加 196B Engram 参数构成,支持 1M 上下文与 890B KV 缓存压缩。官方称其 agentic 基准成绩超过 GPT-5.6 Sol 与自家 V4 Pro,而每任务成本仅为 GPT-5.6 Sol 的三分之一。技术报告解读指出,其通过三层压缩以约三分之一参数量在 Artificial 基准上击败 1.6T 参数模型。

2026-09-12 ~ 2026-09-13 · 3 条相关