DeepSeek 每 token 仅 890 字节,长上下文评测受期待

teortaxesTex · x · 2026-09-10

teortaxesTex 指出 DeepSeek 新模型每 token 仅约 890 字节,压缩率异常之低,并希望看到其长上下文评测成绩,以验证在极致 KV 缓存压缩下长文能力是否可靠。

所属事件:DeepSeek 九个月将 KV 缓存压缩 54 倍,token 效率看齐 OpenAI(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →