自研 60MB 量化模型,支持 1 亿token 磁盘上下文

Final-Data-1410 · reddit · 2026-08-24

开发者开源了自研的 2.5 亿参数模型 SHADOW-250M,经量化后体积仅 60MB,无需 GPU 即可在 CPU 上达到 400 tok/s。该模型采用非传统的词表编码和一种独特的上下文机制:近期 2048 token 存于 fp16 KV 缓存,更久的历史数据被压缩至 1 bit 并写入磁盘,理论上支持最高 1 亿 token 的历史检索。作者演示了在 5000 万 token 深度的归档中精准检索序列号的能力,并提供了完整代码、微调工具及测试数据。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →