DeepSeek 新技术报告解读:KV 仅 890 字节/token,为推理而生
nrehiew_ · x · 2026-09-11
研究员 nrehiew 点评 DeepSeek 最新技术报告,认为其比 v4 的 HSA+CSA 组合更干净。要点:
- 为推理而设计:架构明显以推理优先,因 RL 模糊了训练与推理的边界
- KV 压缩惊人:在此架构下达到基准成绩仅需 890 字节/token 的 KV 大小
- 推理-性能曲线非线性:作者对推理性能图不完全线性感到疑惑,怀疑类似 FrontierCode 那样存在代码质量惩罚;agent swarm 图则更线性
- Agent 团队模式:报告称用 RL 显式训练 agent team mode,奖励函数结合任务表现与协作指标
- 判断:鉴于 OpenAI、Anthropic 有自研推理芯片,它们大概率不会做这种「架构拼接怪」式的极端设计
所属事件:DeepSeek V4.1 技术报告解读:KV 压缩与推理努力参数引热议(9 条相关)→
「模型」频道最新
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11