ICML级论文:用CLIP式架构从脑电波解码语音
Ilia Semenkov · hf · 2026-08-07
本研究提出了一种改进的深度学习架构,通过非侵入性脑磁图(MEG) recordings 来检索和解码人类感知的语音。
核心方法与改进
- 模型架构:采用 CLIP 风格的目标函数,将 MEG 信号与 wav2vec 2.0 音频嵌入进行对比学习。
- 物理先验融合:将原本基于扁平传感器布局的空间注意力机制,替换为基于 3D MEG 头盔几何形状的球谐函数。这使得受试者特定的表征分支从 270 个大幅压缩至 25 个。
- 抗捷径训练:在训练前主动移除眼动和心跳等伪影成分,以降低模型学到刺激锁定“捷径”的风险。
实验结果与可解释性
- 性能:在 MEG-MASC 数据集上,1005 个候选样本中实现了 39.75% 的 Top-1 准确率,且解码器参数量减少了约 20 倍。
- 神经学意义:模型权重成功映射回大脑源空间,恢复的信号生成模式与人类语音感知网络一致。分析发现,左侧大脑半球的分支携带了右侧未明显表现的高频节律成分。
- 驱动特征:通过遮挡实验发现,静音、声音强度、元音和声学起始等 15 个刺激特征对解码贡献最大。此外,有叙事结构的连贯语音比无意义的随机词汇列表包含更多可恢复的脑电信息。
「研究」频道最新
- Google开源WeatherNext 2模型,热带气旋预测提前一天 — ZoubinGhahrama1 · 2026-08-07
- 纽伦堡理工大学招收VLA与3D几何方向博士生 — y_m_asano · 2026-08-07
- 斯坦福与 Arc Institute 用 AI 设计出可杀菌的完整病毒基因组 — The Decoder · 2026-08-07
- 大模型训练遇高熵崩溃,开发者实搭 LoRA 优化显存同步 — mervenoyann · 2026-08-07
- 开源项目Noether:用 Lean 自动证明 JAX 代码的数学性质 — jonkhler · 2026-08-07
- LabyrinthBench发布:测多步Agent上下文记忆,擦除历史反而更强 — jwdeaver · 2026-08-07