Decoding silent reading from non-invasive EEG
Ingo Marquardt, Anthilia Alchanat, Priyanka Jain
cs.LG, q-bio.NC
2026-08-20
一名被试约49小时19导干电极EEG,CLIP对齐Llama词向量做开放词表默读解码:run内top-10增益均值6.7个百分点,随数据对数线性上升、未见饱和。
侵入式脑机接口已经能从运动皮层解码内心言语:12.5 万词表、接近对话速率。头皮 EEG 一直没跟上。卡点是标签,不是「脑电里没有语言」。自发内心独白没法打精确时间戳;提示后反复默念节奏太慢、被试会走神且走神无法核验;事后报告自己刚想了什么,又对不齐到几十毫秒的脑电结构。
nubrain 把默读当成能堆数据的代理任务。一名被试、19 导干电极、连续叙事的 RSVP(快速序列视觉呈现),约 49 小时、约 24 万次单词呈现。问题收成一句:对比解码器能从这段 EEG 里抽出多少词级和语义信息。
文本是福尔摩斯故事,每个 run 约 600 词,叙事跨 run 接续。每个词独立随机字体、字号、颜色和字距,用来削弱「固定视觉模板等于词身份」。词在屏幕上停留 500–900 ms,按时长随字数缩放,再加最多 100 ms 抖动。前 171 个 run 词间隔 100 ms,之后改为 0。
预处理故意做得很轻:去线性趋势、陷波 50 Hz、带通 1–80 Hz,幅值超过 100 μV 的 trial 丢掉。分析窗长度固定,避免模型从窗长读出词长这个非神经线索。
EEG 编码器是双通路卷积:全局通路用注意力池化压成一条向量,局部通路保留 6 个粗时间箱。可选再接 4 层因果 Transformer,只看本 run 里更早的 trial。目标来自 Llama-3.1-8B:第 0 层是词身份嵌入,不含前文;第 20 层是中层隐状态,带着叙事上下文。两边投影到 256 维 L2 归一化空间,用对称 CLIP 损失对齐。
评测是 512 个候选 trial 的词聚合 top-10 检索,减去经验置换基线,所以机会水平是 0 个百分点。主指标是 run 内增益:候选全来自同一段文本,跨 run 的主题追踪帮不上忙。另外用 run 内互换预测测「段落身份」成分;再把当前 trial 的 EEG 换成 [MASK],把位置编码这个非神经先验单独量出来。
Sweep 1 的 576 次拟合,run 内增益均值 6.7±2.7 个百分点,576 次全为正;Sweep 3 的 192 次也全为正。训练前该指标大约在 ±0.2 个百分点,观察到的最小值 1.4 已经高一个数量级。
| 配置 | run 内增益 | 总体增益 | 上下文追踪 |
| L0,无 Transformer | 7.5±2.0 | 7.9±1.9 | 1.0±0.5 |
| L0 + Transformer | 6.2±2.2 | 7.9±2.3 | 1.9±0.8 |
| L20,无 Transformer | 5.5±2.5 | 11.0±3.2 | 4.6±1.6 |
| L20 + Transformer | 7.8±3.3 | 19.8±6.1 | 5.9±1.5 |
无上下文、无序列模型时,几乎全部增益都是词级:上下文追踪只剩 1.0 个百分点。L20 加 Transformer 总体增益最大,约 30%(5.9/19.8)来自「知道在读哪一段」。位置探针再切一刀:7.8 里有 2.7 是位置先验,1.9 是前文 EEG,3.1 是当前 trial。扣掉位置后,词级解码大约 5.1 个百分点,并不高于 L0 无 Transformer 的 7.5。
信号不限于高频功能词。Sweep 1 里 L0 无 Transformer:低频、中频、高频分别是 3.2、3.2、8.1 个百分点;L20 加 Transformer 是 6.0、6.0、8.1。
缩放实验把训练集从 10% 拉到 100%,验证集固定。L20 加 Transformer 的 run 内增益从 6.2 升到 15.0 个百分点,斜率 +8.7 个百分点/十倍数据,R²=0.98;L0 无 Transformer 从 5.0 到 10.1,斜率 +4.8。约 49 小时处曲线仍在涨。
去掉枕叶和后颞 4 导(O1、O2、T5、T6),run 内增益从 9.2 降到 6.3(相对下降 32%),上下文追踪几乎不动(下降 4%)。大约三分之二的词级增益还在。EEG 空间分辨率差,这不是干净的非视觉证明。分析窗 0.7 s 优于 0.5 s(8.3 对 6.9),0.9 s 不再涨;训练时把窗随机平移 ±100 ms,增益掉 39%。
这是给非侵入内心言语脑机接口铺数据的一步,还不是内心言语本身。侵入式工作已经提示阅读、听、发声、内心言语共享表征;EEG 信噪比下这件事能不能迁移,这篇没测。眼前能确定的是:开放词表、自然叙事、干电极、单被试大约 49 小时,词级信息能从 EEG 里抠出来,而且还在吃数据。
如果要复现或跟进,CLIP 对齐预训练 LLM 隐状态这条路线是可操作的。评测必须把主题追踪和位置先验拆开,否则 L20 加 Transformer 的 19.8 个百分点总体增益会被当成词级成绩。硬件是 Wearable Sensing DSI-24,19 导干电极、600 Hz,偏可长时间佩戴,不偏实验室湿电极上限。
全部数字来自一个人。作者另采了约 60 人各 1–2 个 session,跨被试分析还没写。指标在验证集上选 checkpoint、选配置,绝对值是上限。
RSVP 把词钉在屏幕中央逐个弹出,消掉了眼动和副中央凹预视,时间锁得住,也不是自然阅读。解码是从给定候选里检索,不是生成文本。视觉混淆没有被排除:随机排版去掉了模板匹配,去不掉词形与词身份的系统相关;去掉枕导后信号还在,体积传导下枕叶源仍能漏到额中央电极。作者把听力条件当作决断实验,这篇里没有。
内心言语解码仍是后续议程:先在阅读和听力上证明抽到的是跨模态语言信息,再用小规模内心言语数据微调。