10 亿参数 HRM 架构追平 Qwen 3.5 4B:丹麦团队只用合规数据训出 Mimir

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

cs.CL, cs.AI

2026-08-14

丹麦基金会用非 Transformer 的 HRM 架构从零训出 1B 模型 Mimir,161 个合规数据集、70.5B token,英文均分 69.0 仅落后 Qwen 3.5 4B 0.3 分,丹麦语 56.8 刷新纪录。

这篇在解决什么

现在的开源模型几乎都在一条「巨石配方」上:先抓几万亿 token 的网络数据做预训练,再做多阶段后训练。这条路线有两个问题。一是算力门槛,预训练一次就要数百万美元起步;二是数据权利,Common Crawl 一类的语料版权状态模糊,坚持只用合规数据的项目根本凑不出预训练所需的量。丹麦基金会模型项目(DFM)就卡在这里:丹麦语的高质量合规语料太少,按传统配方从零训一个丹麦语模型不现实。

HRM-Text 框架(Wang et al. 2026)给了一条岔路:跳过大规模预训练,直接把「后训练数据」当初训练数据用。Mimir v1 是这个思路在 1B 规模、丹麦语+英语双语上的完整落地,也是第一个公开发布的 HRM 架构第三方复现。

方法

先说架构。HRM(Hierarchical Reasoning Model,层级推理模型)不走 Transformer 的单向解码路线,核心是两个不同时间尺度的循环网络层级协作:高层网络(H-cycle)负责慢节奏的抽象规划,低层网络(L-cycle)负责快节奏的具体计算,每读入一段输入,高层推进少数几步、低层推进更多步。这种结构模仿大脑皮层的多时间尺度层级,换来的是推理时可以用更少的参数和更少的 token 完成多步计算,代价是训练比同规模 Transformer 更不稳定,需要截断反向传播(只回传 5 步)来控制。Mimir 的具体配置:hidden size 1536、32 层(实际激活一半)、2 个 H-cycle 加 3 个 L-cycle、RoPE 位置编码、Gemma-4 tokenizer。

数据侧是这篇真正的重头。161 个数据集、每 epoch 70.5B token,全部满足「合规」:要么开放许可,要么签了协议,要么落在欧盟文本与数据挖掘研究豁免内,含个人信息或侵犯版权的一律不要。成分上英语占 68.6%、丹麦语 24.7%、双语 6.5%;按类别,丹麦语指令与知识占 22.1% 排第一,英语指令 19.3% 第二,Sapient 混合集 17% 第三,数学与推理 14.8%。

两个值得注意的设计选择。第一,原版 HRM-Text 的训练数据(Sapient 集)以多项选择题为主,模型学到的是「从 ABCD 里挑」;Mimir 把语料重心换成自由生成,56.1% 的 token 来自要求模型写出答案的任务(数学、DROP 式阅读理解、开放式指令),对齐了 GSM8K、MATH 这类按精确匹配打分的评测。第二,对拿不到许可的数据,他们用 Gemma4 31B 合成「移植数据集」替代:70 个 Sapient-synth 替身共 75M token,生成后逐批做质量审计,论文称这些合成替身达到与原版相当或更好的效果。

训练开销:8 张 B200,165 万步,不到三周,单步约 1.1 秒。对一个国家级项目来说,这个量级是可以承受的。

结果

20 个基准,三个板块。英文七项(BoolQ、Winogrande、Hellaswag、MMLU、ARC-C、DROP、GovReport):

模型英文均分数学代码均分丹麦语均分
Mimir 1B69.064.156.8
HRM-Text 1B66.146.921.7
Qwen 3.5 4B69.365.049.2
Gemma 4 E2B(5B,有效 2.3B)56.675.444.6
SmolLM3 3B63.167.931.7

几个具体数字:英文均分 69.0,与四倍参数量的 Qwen 3.5 4B 只差 0.3,Winogrande(73.5)和 DROP(83.1)直接排第一。数学代码板块,GSM8K 拿 89.9 排全场第二、HumanEval 56.7 在同量级领先,均分 64.1 比原版 HRM-Text 1B 高出 36.7%。丹麦语是碾压局:11 项基准均分 56.8,语法改错(GEC)85.6、WikiQA 66.8 都排第一,比第二名 Qwen 3.5 4B 的 49.2 高 7.6 分,把同规模基线(HRM-Text 21.7、Qwen 0.8B 34.2)远远甩开。

短板也明摆着:MATH 45.8 低于 SmolLM3 3B 的 62.2,数学代码整体落后 Gemma 4 E2B 十一分,那是有效 2.3B、预训练量完全不同的模型。

为什么重要

对低资源语言社区,这是一份可抄的作业:70B token 量级、单机八卡三周,就能训出一个本国语言刷新纪录、英文不输四倍参数模型的开放模型,数据清单 161 项全部公开。「合成移植」思路对任何因版权拿不下数据集的团队都有参考价值,论文的证据是替代品不掉点。

对架构研究,这是 HRM 路线第一次在第三方手里跑通并公开发布(Sapient 原版代码基础,框架开在 GitHub),且在 MATH、HumanEval 上验证了非 Transformer 架构的代码与符号推理能力,原版 HRM-Text 的 HumanEval 是 0.0。当然,「只用后训练数据」这个前提本身就限定了适用范围:它赌的是指令数据足以撑起能力,这份结果是支持该赌注的一票,但只有 1B 一个点,scaling 行为论文自己承认还没验证。

局限与存疑

作者自述:数学代码落后 Gemma 4;助手能力仍有限;RL 对这个架构还没人探索;数据集许可还没做到完全开放;scaling 行为待研究。

读下来另有几处存疑。丹麦语 11 项基准里有一批(如 DaLA、GEC)与 DFM 自家的训练数据同源或风格相近,领先幅度可能部分来自数据亲缘,而不是通用丹麦语能力;lærebogen 一个数据集重复采样 4 次、占语料 11.8%,加重了这一点。评测都是贪婪解码、全量数据集,没有报告方差。所谓「移植数据集效果相当或更好」没有给单独的消融数字,只有一句话结论。另外 HRM 的推理成本优势(这是该架构的核心卖点)在论文里没有实测对比,只有架构层面的论证。

原文与代码

社区讨论

相关论文

全部论文解读