牛津LibriBrain100:单人80小时MEG,跨被试10分钟微调仍有效

LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale

Francesco Mantegna, Dulhan Jayalath, Gereon Elvers, Tasha Kim, Benjamin Ballyk, Alex Fung, SungJun Cho, Teyun Kwon, Luisa Kurth, Miran Özdogan, Gilad Landau, Pratik Somaiya, Natalie Voets, Mark Woolrich, Oiwi Parker Jones

cs.LG, cs.CL

2026-08-26

牛津把听语音MEG扩到104小时:一人80.5小时,另32人各约44分钟。50词分类上,带上这80小时后跨被试top-10准确率从0.329升到0.478,微调砍到约10分钟几乎不掉。

这篇在解决什么

侵入式语音脑机接口已经能把部分瘫痪患者的词错误率打到 5% 以下,但要开颅。非侵入式才可能规模化,缺的是 ImageNet 那种可复现评测:共享数据、标准切分、公开榜。牛津 PNPL 先前的 LibriBrain 把单人 MEG 做到 52.3 小时,解码涨得很快,可只有一名被试、刺激几乎全是福尔摩斯有声书。深度有了,广度没有。

LibriBrain100 把深度再往上加,同时补上跨被试。听语音不是最终 BCI 范式(用户得试图说或默说),但它对齐容易、信噪比高,是这条线上的台阶。

方法

数据在牛津 OHBA 的 MEGIN TRIUX Neo 上采,306 通道(102 磁力计 + 204 梯度计),原采样 1 kHz,预处理降到 250 Hz。33 名健康志愿者,10 女 23 男,年龄 19–50,中位 28。16 人英语母语,17 人高熟练二语。

体量(论文 Table 1,小时):

部分刺激被试合计训练 / 验证 / 测试
Deep,Subject 0Sherlock 全书168.167.3 / 0.4 / 0.4
TIMIT15.34.9 / 0.2 / 0.2
MOCHA-TIMIT11.10.8 / 0.2 / 0.2
The Moth 30 期播客16.05.7 / 0.2 / 0.2
Deep 小计180.578.6 / 1.0 / 0.9
Broad,Subject 1–32Sherlock 两章3223.7— / 11.5 / 12.2
总计33104.278.6 / 12.5 / 13.1

相对前代:单人从 52.3 小时拉到约 80;比下一家深度集 Armeni(3 人 × 10 小时)大约 8×,比其余常见 MEG 听语音集大约 80×。刺激上补了两条轴:TIMIT / MOCHA-TIMIT 控制音素分布,方便跟 ASR 和侵入式 BCI 文献对齐;30 期 The Moth 播客走语义多样性,方便跟 Tang 等人的 fMRI 语义解码比。

评测主任务是 50 词分类:词 onset 后取一段 MEG,映射到固定词表,指标是按类平均的 top-10 准确率,随机基线 0.20。主干用现成的 MEG-XL:在约 300 小时、800 名被试的多数据上自监督预训练,再在 LibriBrain100 上微调。数据走 Hugging Face,加载器用 pnpl。

结果

Subject 0 留出测试(Figure 2,balanced top-10):

测试子集S0+S1–32只用 S0只用 S0 的 Sherlock
有声书 Sherlock0.4920.5190.585
TIMIT0.4310.393
MOCHA-TIMIT0.5010.436
播客0.4640.399

域内 Sherlock,训练分布越杂,分数略降;训练只留福尔摩斯时最高。TIMIT / MOCHA / 播客这种分布偏移上,32 名浅被试反而帮 S0 泛化。

跨被试(Figure 3,Sherlock 测试):带上 S0 的约 80 小时,32 人聚合从 0.329 升到 0.478,大约 15 个百分点,32 人方向一致。随机基线仍是 0.20。

数据砍到 25%(约 10 分钟微调,Figure 4):带 S0 时 100% / 50% / 25% 为 0.492 / 0.488 / 0.482,差异未过显著性;不带 S0 则卡在 0.33 左右。跨被试迁移在扛大部分分数,浅被试微调量不是瓶颈。

附录里纯监督的 d'Ascoli 模型在深被试上到 0.739,高于 MEG-XL 的 0.585;浅的 32 人上反过来,MEG-XL 0.478 对监督 0.328。主文没有把这个对照放进正文。

为什么重要

非侵入语音解码现在有一份能当 ImageNet 用的基础设施:标准切分、Python 加载器、计划中的公开竞赛。深度优先仍然成立:一人 80 小时,能把只有 40 分钟甚至 10 分钟的新人托起来。

跟现有 MEG 集比,这是目前最深的听语音数据,广度排第三(33 人,MOUS 96、Le Petit Prince 58)。ML 研究者可以不管 FIF/BIDS,直接拿 HDF5 窗口。想自己做预处理的人仍有 raw。

诚实讲,这是数据集加基线,不是新解码算法。50 词、听语音、top-10,离开放式脑到文本还远。

局限与存疑

作者自己点了两条硬伤。全部是被动听连续语音,BCI 要的是试图说或内心言语,信噪比和对齐都会差一截;他们在另采内心言语,这篇没有。开放式脑到文本基线被有意拿掉,理由是方法还不稳定、不适合当社区锚点。

被试全是健康志愿者,10 分钟微调的临床故事还没有病人数据。词表 50 个高频词,功能词居多,top-10 在 50 类上随机已是 0.20,读数字时别当成开放词汇 ASR。MEG 设备贵、要磁屏蔽,实验室数据,不是头戴式 EEG。

主模型 MEG-XL 在最深的那名被试上,还不如附录里那个更简单的监督模型。把「现有模型达到 SOTA」写进摘要,对照不完整。

术语

原文与代码

相关论文

全部论文解读