2026-08-19
伊尔梅瑙工大用20.1万条第一性原理金属介电函数训练图网络。数据缩放不是一条幂律:过了约三万条后指数从0.16跳到0.40,参数缩放在五百万附近就饱和。
材料数据又贵又少。神经缩放律本来该告诉你:再算一批结构、再加一层宽,损失会按什么幂掉下去。视觉和语言模型大体是一条光滑幂律;材料图网络这边,系统测量几乎还没开始。如果缩放会拐弯,按小数据外推去规划高通量计算,会把预算花在错误的一侧。
金属光学响应是一个刚好能量起来的任务。屏蔽强、激子弱,独立粒子近似加Drude项就能和实验对上。半导体光学数据集通常不到三万条光谱;这里把规模抬高一个数量级,专门用来看缩放。
从Alexandria库筛出只含金属元素、原胞不超过10个原子的金属间化合物,用Quantum ESPRESSO加SIMPLE做高通量DFT,得到201,361条收敛的频域复介电函数和Drude频率,花了约230万CPU小时。按化学式80/10/10切开。模型是精简过的不变图网络OptiMetal2B/3B,分别做二体和三体消息传递,同时回归整条谱和标量Drude频率,损失是两项MAE之和。
数据缩放把训练集抽成2500到16万的七档,隐藏维固定256(约一千万参数)。参数缩放扫隐藏维16到1024(约十万到一亿参数),数据固定两万。候选函数用小样本修正的AIC挑选:简单幂律、带饱和地板的幂律、两种光滑折断幂律。
数据缩放一致选中光滑折断幂律。低数据端指数αD,1≈0.15–0.18;越过断点Dc≈10^4.4–10^4.7(大约两万到五万条)后,αD,2升到0.38–0.42。二体和三体的指数差不多,三体整条曲线更低一截。参数缩放是带地板的幂律,αN=0.41–0.58,过大约五百万参数就饱和。
二维图L(D,N)说明拐弯不是「模型太大」的假象。数据和容量匹配时(大约一百万参数)接近单条幂律;过参数化后再出现折断,三体的两段指数分得更开(0.16对0.46)。消息传递换成Crystal Graph Convolution还是Transformer Convolution,缩放几乎不变。
| 模型 | αD,1 → αD,2 | 断点Dc | αN |
| OptiMetal2B (CGC) | 0.15 → 0.42 | 10^4.72 | 0.53 |
| OptiMetal2B (TC) | 0.18 → 0.39 | 10^4.62 | 0.58 |
| OptiMetal3B (TC) | 0.17 → 0.38 | 10^4.43 | 0.41 |
材料学里再堆参数很快就不划算,数据才是瓶颈。但这条数据曲线会在三万量级变陡:过了拐点,同样贵的一条新光谱值更多。规划数据集时要按两段预算,不能拿两千条上的斜率去外推到十六万。加三体相互作用能平移损失,改的是数据效率,不是参数效率。
全文读到的是arXiv版本,只覆盖不变GNN;PRX Intelligence刊出稿摘要还加了等变网络,那些数字不在这份PDF里。任务限于金属、独立粒子近似加Drude项,绝缘体和激子体系未必同样拐弯。断点附近只有七个数据档,函数形式靠AIC在小样本上选,换网格可能移动Dc。训练共用一套为dh=256调好的超参,再按参数量缩放学习率,不能排除优化器耦合进了缩放曲线。