DeepSeek V4 Flash公测上线,低成本Agent能力引关注
DeepSeek于8月4日推出V4 Flash API公测版,主打大幅提升的Agent能力、工具调用与长任务处理表现,并以极低的推理成本引发业界关注。该模型已陆续上线Together AI与CoreWeave等平台,凭借出色的性价比进一步推动了市场推理定价的下降。
已确认
- 模型具体规格为总参数量284B,单token激活13B,支持1M token上下文窗口,并采用混合注意力机制。
- 在基于1.25万次真实Agent会话的Agent Arena测试中,DeepSeek-V4-Flash在开源模型中排名第三。
- 该模型原生支持Responses API格式与Codex适配,在终端、代码仓库和全栈任务中的编码能力得到显著增强。
- Together AI平台已上线该模型,并支持可调推理(low / high / max)模式。
- W&B官方确认,DeepSeek-V4-Flash-0731也已正式在CoreWeave的无服务器推理平台上线。开发者@ScottCondron实测后反馈,该模型在数据提取等任务上表现出色,兼顾了处理速度与低成本。
尚未确认
- 关于“价格仅为竞品的1/57”的说法来自Together AI的发布公告,具体对比基准未详细说明。
- 开发者@orange转述的“十余亿token胜过大几十亿GPT”等具体对比数据,因原始帖子未提供完整上下文,暂无法核实。
为什么重要
- DeepSeek V4 Flash提供了前沿级的agent能力,同时大幅压低了推理成本(据称价格仅为竞品的1/57)。
- 据@teortaxesTex分析,该模型带来的Disk KV cache是一项杀手级特性,这种架构突破看似会对其他大模型厂商构成威胁,但由于DeepSeek采取完全开源策略,实际上对整个开源生态是巨大利好。
- @infwinston与@intellectronica均认为,这不仅为开发者提供了极具性价比的选择,更形成了一股强大的市场力量,有效推动了全行业AI推理定价的下降。
2026-08-04 ~ 2026-08-06 · 9 条相关
- 第 1 集:DeepSeek V4 Flash公测上线,低成本Agent能力引关注(2026-08-04,9 条)
- 第 2 集:DeepSeek-V4-Flash 登顶 Ollama 增速榜首(2026-08-05,2 条)
一手来源
- Together AI 上线 DeepSeek V4 Flash,主打编码和 1/57 价格 — togethercompute ·
- DeepSeek V4 Flash 0731 上线 Together AI,带来 284B 参数和 1M 上下文 — togethercompute ·
- DeepSeek-V4-Flash正式上线CoreWeave无服务器推理平台 — wandb ·
- 【源头】Together AI 上线 DeepSeek V4 Flash,主打编码和 1/57 价格 — togethercompute · 2026-08-04
- 【源头】DeepSeek V4 Flash 0731 上线 Together AI,带来 284B 参数和 1M 上下文 — togethercompute · 2026-08-04
- DeepSeek-V4-Flash 上线 Agent Arena,开源模型中排名第三 — infwinston · 2026-08-04
- DeepSeek V4 Flash 发布,进一步压低推理成本 — intellectronica · 2026-08-05
- 【源头】DeepSeek-V4-Flash正式上线CoreWeave无服务器推理平台 — wandb · 2026-08-06
- CoreWeave 上线 DeepSeek V4-Flash-0731 推理服务 — _ScottCondron · 2026-08-06
- DeepSeek v4 Flash架构被低估,Disk KV cache大幅降低推理成本 — teortaxesTex · 2026-08-06
- 开发者称 DeepSeek v4 flash 效率极高,十余亿 token 胜过大几十亿 GPT — oran_ge · 2026-08-06
另有 1 条近重复转述:togethercompute