4.5MB 无 Transformer 语言模型 MICA 分家:Ember 与 Flame 评测进展
Silver_Employ2617 · reddit · 2026-09-28
作者更新基于「整数重写规则+元胞带」的微型语言模型 MICA:项目拆为约 4.5MB 的 Ember 和约 17MB 的 Flame,推理完全不用 Transformer/GRU。Flame 在聊天集上达 1.786 bits/target(此前 1.847),但日常文本 1.966 劣于旧版 1.742;均衡混合训练的 Ember 得 1.861/1.876,更均匀但仍非最优。最大难题是生成:预测损失降低尚未转化为连贯新句,生成仍重复短语。作者向社区求教如何区分数据配比/上下文/解码问题,目标仍是约 1 bit/target。实现工作大部分由 Claude 完成。
「研究」频道最新
- Hillock 开源引擎:用三元组+Hebbian 权重替代向量库,1.2GB 显存跑本地 agent 记忆 — Equivalent-Flan-1590 · 2026-09-28
- Hillock v0.7 架构详解:SQLite+Hebbian 关联+超维门控取代向量库与 LLM 抽取 — Equivalent-Flan-1590 · 2026-09-28
- 北大开源 RayOrch:数据准备管线最高提速 15.14 倍 — PekingUniversity · 2026-09-28
- YODAS v3 发布:110万小时语音数据,史上最大开源音频数据集 — shinjiw_at_cmu · 2026-09-28
- 「图对齐就是你所需要的」报告登陆 CIRM 图论研讨会 — marc_lelarge · 2026-09-28
- AI 挑出"不靠谱"材料,催化剂抗酸超千小时 — VraserX · 2026-09-28