250M 参数自研模型:60MB 部署,支持亿级磁盘上下文

Final-Data-1410 · reddit · 2026-08-22

作者从零训练了一个 250M 参数模型,在 30B token 上训练并量化至不到 2 bit,部署包仅 60MB,CPU 推理速度达 400 tok/s。其特色是长上下文机制:最近 2048 token 用 fp16 KV Cache,更早数据压缩为 1 bit 存入磁盘(约 320 bytes/token),支持检索高达 1 亿 token 的历史,虽不在此长文本上推理但能精准检索。词表采用固定 512-bit 码,无训练参数。模型在 5060 万 token 深度下能准确检索序列号。代码与权重已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →