数值记忆法跨三架构验证:DeepSeek-V2-Lite 仅 2.58 MiB 答对 69/72

Nearby_Indication474 · reddit · 2026-10-11

作者将自研的 AKBASCORE MAM(source-free 数值记忆:读一次原文、写入数值记忆、巩固后无需回喂原文即可答题)应用到第三个 Transformer 家族 DeepSeek-V2-Lite-Chat,并对比了此前在 Mistral 和 Qwen 上的实现。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →