单被试49小时干电极EEG,默读开放词表对比解码仍未饱和

Decoding silent reading from non-invasive EEG

Ingo Marquardt, Anthilia Alchanat, Priyanka Jain

cs.LG, q-bio.NC

2026-08-20

一名被试约49小时19导干电极EEG,CLIP对齐Llama词向量做开放词表默读解码:run内top-10增益均值6.7个百分点,随数据对数线性上升、未见饱和。

这篇在解决什么

侵入式脑机接口已经能从运动皮层解码内心言语:12.5 万词表、接近对话速率。头皮 EEG 一直没跟上。卡点是标签,不是「脑电里没有语言」。自发内心独白没法打精确时间戳;提示后反复默念节奏太慢、被试会走神且走神无法核验;事后报告自己刚想了什么,又对不齐到几十毫秒的脑电结构。

nubrain 把默读当成能堆数据的代理任务。一名被试、19 导干电极、连续叙事的 RSVP(快速序列视觉呈现),约 49 小时、约 24 万次单词呈现。问题收成一句:对比解码器能从这段 EEG 里抽出多少词级和语义信息。

方法

文本是福尔摩斯故事,每个 run 约 600 词,叙事跨 run 接续。每个词独立随机字体、字号、颜色和字距,用来削弱「固定视觉模板等于词身份」。词在屏幕上停留 500–900 ms,按时长随字数缩放,再加最多 100 ms 抖动。前 171 个 run 词间隔 100 ms,之后改为 0。

预处理故意做得很轻:去线性趋势、陷波 50 Hz、带通 1–80 Hz,幅值超过 100 μV 的 trial 丢掉。分析窗长度固定,避免模型从窗长读出词长这个非神经线索。

EEG 编码器是双通路卷积:全局通路用注意力池化压成一条向量,局部通路保留 6 个粗时间箱。可选再接 4 层因果 Transformer,只看本 run 里更早的 trial。目标来自 Llama-3.1-8B:第 0 层是词身份嵌入,不含前文;第 20 层是中层隐状态,带着叙事上下文。两边投影到 256 维 L2 归一化空间,用对称 CLIP 损失对齐。

评测是 512 个候选 trial 的词聚合 top-10 检索,减去经验置换基线,所以机会水平是 0 个百分点。主指标是 run 内增益:候选全来自同一段文本,跨 run 的主题追踪帮不上忙。另外用 run 内互换预测测「段落身份」成分;再把当前 trial 的 EEG 换成 [MASK],把位置编码这个非神经先验单独量出来。

结果

Sweep 1 的 576 次拟合,run 内增益均值 6.7±2.7 个百分点,576 次全为正;Sweep 3 的 192 次也全为正。训练前该指标大约在 ±0.2 个百分点,观察到的最小值 1.4 已经高一个数量级。

配置run 内增益总体增益上下文追踪
L0,无 Transformer7.5±2.07.9±1.91.0±0.5
L0 + Transformer6.2±2.27.9±2.31.9±0.8
L20,无 Transformer5.5±2.511.0±3.24.6±1.6
L20 + Transformer7.8±3.319.8±6.15.9±1.5

无上下文、无序列模型时,几乎全部增益都是词级:上下文追踪只剩 1.0 个百分点。L20 加 Transformer 总体增益最大,约 30%(5.9/19.8)来自「知道在读哪一段」。位置探针再切一刀:7.8 里有 2.7 是位置先验,1.9 是前文 EEG,3.1 是当前 trial。扣掉位置后,词级解码大约 5.1 个百分点,并不高于 L0 无 Transformer 的 7.5。

信号不限于高频功能词。Sweep 1 里 L0 无 Transformer:低频、中频、高频分别是 3.2、3.2、8.1 个百分点;L20 加 Transformer 是 6.0、6.0、8.1。

缩放实验把训练集从 10% 拉到 100%,验证集固定。L20 加 Transformer 的 run 内增益从 6.2 升到 15.0 个百分点,斜率 +8.7 个百分点/十倍数据,R²=0.98;L0 无 Transformer 从 5.0 到 10.1,斜率 +4.8。约 49 小时处曲线仍在涨。

去掉枕叶和后颞 4 导(O1、O2、T5、T6),run 内增益从 9.2 降到 6.3(相对下降 32%),上下文追踪几乎不动(下降 4%)。大约三分之二的词级增益还在。EEG 空间分辨率差,这不是干净的非视觉证明。分析窗 0.7 s 优于 0.5 s(8.3 对 6.9),0.9 s 不再涨;训练时把窗随机平移 ±100 ms,增益掉 39%。

为什么重要

这是给非侵入内心言语脑机接口铺数据的一步,还不是内心言语本身。侵入式工作已经提示阅读、听、发声、内心言语共享表征;EEG 信噪比下这件事能不能迁移,这篇没测。眼前能确定的是:开放词表、自然叙事、干电极、单被试大约 49 小时,词级信息能从 EEG 里抠出来,而且还在吃数据。

如果要复现或跟进,CLIP 对齐预训练 LLM 隐状态这条路线是可操作的。评测必须把主题追踪和位置先验拆开,否则 L20 加 Transformer 的 19.8 个百分点总体增益会被当成词级成绩。硬件是 Wearable Sensing DSI-24,19 导干电极、600 Hz,偏可长时间佩戴,不偏实验室湿电极上限。

局限与存疑

全部数字来自一个人。作者另采了约 60 人各 1–2 个 session,跨被试分析还没写。指标在验证集上选 checkpoint、选配置,绝对值是上限。

RSVP 把词钉在屏幕中央逐个弹出,消掉了眼动和副中央凹预视,时间锁得住,也不是自然阅读。解码是从给定候选里检索,不是生成文本。视觉混淆没有被排除:随机排版去掉了模板匹配,去不掉词形与词身份的系统相关;去掉枕导后信号还在,体积传导下枕叶源仍能漏到额中央电极。作者把听力条件当作决断实验,这篇里没有。

内心言语解码仍是后续议程:先在阅读和听力上证明抽到的是跨模态语言信息,再用小规模内心言语数据微调。

术语

原文与代码

社区讨论

相关论文

全部论文解读