BrainWideBench: Benchmarking large-scale pretraining and across-animal transfer in multi-region neural recordings
Alexandre Andre, Shivashriganesh P. Mahato, Vinam Arora, Keshav Balaji, Divyansha Lachi, Nanda H. Krishna, Jingyun Xiao, Yizi Zhang, Ximeng Mao, Wenrui Ma, Han Yu, International Brain Laboratory, Daniel Birman, Niccolò Bonacchi, Gaelle A. Chapuis, Joana A. Catarino, Felicia Davatolhagh, Mayo Faulkner, Laura Freitas-Silva, Fei Hu, Julia M. Huntenburg, Anup Khanal, Inês Laranjeira, Petrina Lau, Guido T. Meijer, Nathaniel J. Miska, Jean-Paul Noel, Alejandro Pan-Vazquez, Georg Raiser, Cyrille Rossant, Karolina Z. Socha, Anne E. Urai, Miles J. Wells, Steven J. West, Olivier Winter, Blake Richards, Guillaume Lajoie, Cole Hurwitz, Mehdi Azabou, Matthew R. Whiteway, Liam Paninski, Eva L. Dyer
cs.LG, q-bio.NC
2026-09-19
在IBL 139只小鼠、276个脑区的记录上评跨动物迁移。预训练普遍强过单会话基线,但行为、动力学、解剖三套任务没有同一套方法全赢。
高密度电生理已经能在很多动物、很多脑区同时记到单细胞发放。分析却还是按一次实验、一个脑区分开做。想训练「小鼠脑的通用表征」,缺的是同一套划分、同一套下游、能比跨动物迁移的基准。
现有 spike 级基准要么动物少、覆盖窄,要么只测编码或解码一件事。BrainWideBench 把问题定成:在一批小鼠上预训练,到没见过的小鼠上,同一套权重能不能同时服务行为解码、神经活动预测、脑区识别。
数据来自 International Brain Laboratory 的 Brainwide Map:139 只小鼠做视觉引导的决策任务,Neuropixels 探针覆盖 276 个脑区,原始超过 600 小时。预训练用 126 只鼠、423 个会话;评测留 13 只鼠、29 个会话、124 个脑区。质量过滤的元数据按会话、探针、单元三级提供。
三套任务故意打向不同能力。
基线按预训练目标分成「直接监督下游」(TSS)和「下游以外的自监督」(TSU),再加一组调得很满的单会话模型。
核心结论写在摘要里:预训练相对匹配的单会话基线是涨的,但涨幅高度依赖预训练目标和下游是否对齐,没有方法在三套任务上同时最好。
TS1 上,直接做解码预训练的 POYO+ 平均秩 2.53,POSSM 3.18。POYO 单会话平均秩 4.80,换成 POYO+ 升到 2.53;NDT 从 6.80 升到 NDT-Stitch 的 3.58。舔舐 D²:POYO+ 0.678,线性基线 0.151,单会话 CNN 0.549。选择分类:POYO+ 平衡准确率 0.689,线性 0.614。自监督的 NDT-Stitch、MtM 在胡须、右爪、选择上也能迁过去,说明表征里有超出原目标的结构,但总榜仍是行为监督领先。
TS2 上预训练全面压过单会话潜变量模型。协同平滑 D²:MtM 0.191,NDT-Stitch 0.157,LFADS 0.176。预测未来 D²:NDT-Stitch 0.177,NDT 0.158,MtM 0.131。空间掩码更利协同平滑,时间重建更利预测未来,连非因果预训练都能迁到因果预测。
TS3 把这条缝撕得更大。专攻单元身份的 NuCLR 多单元线性探针宏 F1 到 0.654,NEMO 多单元 MLP 到 0.605。POYO+ 同设定只有 0.072 到 0.132。直接用脑区标签训练的 LOLCAT 多单元 F1 0.473,仍低于 NuCLR。行为解码练出来的嵌入,并不会自动按解剖排好。
这是目前少有的、在多脑区单细胞数据上测跨动物迁移的统一评测。对想做神经基础模型的人,它把「通用」拆成三件可分开输的事:对齐行为、对齐动力学、对齐解剖。现在的方法基本是为其中一件设计的。
实用含义也很硬。单会话模型要靠大量超参搜索才能打满,预训练模型用几乎同一套微调设定就能追上或超过,把调参成本摊到预训练里。缺口同样清楚:行为和解码模型仍要在新会话上校准单元嵌入或 stitcher,真正的零样本校准还没有。
作者列得很明白。只有小鼠、只有 Neuropixels、只有视觉决策这一种行为。评测集 13 只鼠是为了算得起并保住解剖覆盖,粗分组稳定,组内名次对留出哪些动物敏感,不能当逐点排名读。TSS/TSU、是否微调这些标签也只是粗篮子,装不下每家模型的归纳偏置。
TS1 的长会话平均约 1.4 小时,探针漂移和排序质量会变,时间切分故意把这件事留在评测里。TS2 放弃因果切分,等于承认神经元身份在长尺度上不可靠。TS3 的 10 类是粗分区,不是细胞类型。若有人宣布「通吃」,先看它是不是只报了自己那一栏。