DeepSeek 每 token 仅 890 字节,长上下文评测受期待
teortaxesTex · x · 2026-09-10
teortaxesTex 指出 DeepSeek 新模型每 token 仅约 890 字节,压缩率异常之低,并希望看到其长上下文评测成绩,以验证在极致 KV 缓存压缩下长文能力是否可靠。
所属事件:DeepSeek 九个月将 KV 缓存压缩 54 倍,token 效率看齐 OpenAI(4 条相关)→
「模型」频道最新
- Polymarket 预测盘:11 月底前发布下一款 DeepSeek Pro 概率 48% — Polymarket · 2026-09-10
- 传 DeepSeek 发布 V4.1 Flash,每百万 token 低至几分之一美分 — Polymarket · 2026-09-10
- 新论文提出 OPRD:弱教师反向蒸馏让学生模型超越教师上限 — algo_diver · 2026-09-10
- willcb 断言:Transformer 已死,未来属于怪形混合架构 — willcb · 2026-09-10
- Hy4 preview 实测:一条 prompt 产出可玩的 3D 生存游戏 — mhdfaran · 2026-09-10
- Gemini 2.5 Pro 独享 Google 搜索加持,高分或含水分 — Afinetheorem · 2026-09-10