250M 参数自研模型:60MB 部署,支持亿级磁盘上下文
Final-Data-1410 · reddit · 2026-08-22
作者从零训练了一个 250M 参数模型,在 30B token 上训练并量化至不到 2 bit,部署包仅 60MB,CPU 推理速度达 400 tok/s。其特色是长上下文机制:最近 2048 token 用 fp16 KV Cache,更早数据压缩为 1 bit 存入磁盘(约 320 bytes/token),支持检索高达 1 亿 token 的历史,虽不在此长文本上推理但能精准检索。词表采用固定 512-bit 码,无训练参数。模型在 5060 万 token 深度下能准确检索序列号。代码与权重已开源。
「编程与Agent」频道最新
- 如何手写 AI Agent 的浏览器 Harness/MCP 并对比 Playwright — Jin-109 · 2026-08-22
- 集成 Sharp 模板至 NInfer,输出 Token 降 42% — xrailgun · 2026-08-22
- 开发者重实现 Pyramids 模型,基于 ViT-B/32 架构 — cephaloform · 2026-08-22
- 开发 CI 故障诊断智能体,寻求隐状态验证建议 — No-Cheetah-4745 · 2026-08-22
- Semantic API MCP:支持自然语言搜索 700+ API 接口 — modelcontextprotocol · 2026-08-22
- 发布 Remote MCP 服务器:集成 Base64、DNS 查询等 10 种开发工具 — modelcontextprotocol · 2026-08-22