Training, learning and inference: unified dynamics of neural systems
Mian Wang
cs.LG
2026-08-21
武汉轻工大学用生成事实图统一训练与推理动力学。nanoGPT上二阶预测器以91.43%预判对错翻转,过浓强化会压低未强化能力。
训练、学习、推理在工程上是三段活:反向传播改参数、能力在验证集上显现、推理时参数冻住出token。机械上它们经常被拆开讲。数据库有lineage,OpenTelemetry有追踪,PyTorch Autograd有计算图,各自只保留生成过程的一个投影。武汉轻工大学这篇要的是更完整的「一次具体生成」记录,再拿这套记录去追:一次真实的参数更新到底怎样改了能力,冻住的网络又怎样把那次改动用出来。
它不是新优化器,也不是新结构。它是一套带因果干预的训练动力学叙事,实验主体是nanoGPT。
原子生成事实写成五元组:实际参与的来源、真正发生的变换、这次具体出现、生成结果或显式废弃、关系角色。这些事实编译成Generation-Fact Graph(GFG,生成事实图),后续分析、干预、回放、验证会再写下新的事实,接到同一条历史上。
在nanoGPT上,训练被定义成带状态和记忆的「参数-优化器系统」的演化。一次实际更新进入当前接收态(主要是参数加Adam状态),引起的功能响应同时被这个接收态和目标特定的更新几何约束,幅度有限且非线性。学习被定义成这些响应对分布式功能支持的持久重组。只有当某个目标的内部状态穿过对应读出边界,外部才看得到能力形成、维持、下降或恢复。
预测器在更新已经形成、但还没算目标响应时工作。它用当前边界裕度、对更新的一阶和二阶响应,估计更新后裕度是否仍大于零,从而预判四个过渡:保持正确、正确变错、保持错误、错误变对。它能看见Δθ,看不见更新后的前向输出。
推理侧用组件门控和版本回滚:把训练中形成的组件换成形成前的版本,看logits和准确率是否掉、复原后是否精确回来。强化实验则改变正确正反馈的浓度,看目标支持和其他技能裕度如何此消彼长。
八组训练-学习实验(TL-E01到E08)构成链条。接收态交换表明,同一个Δθ打在不同接收态上,功能响应不同。完整更新按幅度α∈{0,0.125,…,1}展开,曲线里反复出现饱和、加速、折返和变号,一阶或二阶局部外推经常到不了端点。72个已实现更新切片上,支持再分配幅度与更新幅度的Spearman相关是0.881,与能力绝对变化相关是0.765;能力变化时平均再分配0.2080,不变时只有0.0340。单个组件的更新幅度并不能可靠决定它后来是得责还是失责。
留出确认集上,二阶边界预测器在5088例里对了4652例:目标边界准确率91.43%,平衡准确率92.17%,四类过渡宏平均召回91.49%。分项召回:保持正确87.18%,正确→错误98.91%,保持错误95.90%,错误→正确83.95%。12条完整训练跑上是14069/15264,准确率92.17%。
十三份nanoGPT历史、52个检查点上,门控改变全部logits;23个目标组给出23种不同的组件需求模式;138组成对门控全部偏离可加性;52次回滚全部降低准确率,复原后logits精确回去。强化实验12/12个种子呈剂量序:独占反馈相对均衡反馈,目标支持份额+9.67个百分点,其他技能准确率−39.06个百分点;再平衡后其他技能回到99.48%,目标仍是100%。ResNet/CIFAR与diffusion/CIFAR各三颗种子复现了接收态条件响应、支持重组和冻结投影,扩散侧另有504条独立核对的响应记录。
对做训练诊断的人,它把「loss降了」拆成可干预的三件事:目标现在离边界多远、这次更新对这个目标的几何、Adam接收态。91%的过渡预测说明,至少在nanoGPT这个系统里,能力翻转不完全是事后才能看见的黑箱。强化那组数字更具体:过浓的正反馈会把支持抽向被强化的能力,旁边的技能裕度跟着塌,把反馈打散又能捞回来。这和「RL会过拟合奖励」是同一类警告,只是测量对象换成了功能支持份额。
它不能直接拿来改你的训练脚本。预测器发生在Δθ已经算完之后,省的是一次目标前向,不是一次反向。GFG这套本体很重,主文几乎不跟现有训练动力学或影响函数文献对齐着写。
单作者、主体是nanoGPT,跨系统验证停在ResNet分类和CIFAR扩散,没有大模型、没有标准NLP基准。预测器用了真实Δθ和边际的一阶、二阶项,等于一次目标相关的二阶泰勒展开,91%验证的是这组坐标够不够,不是能提前知道下一步梯度。Attention那一节是从「查询条件投影 + 联合组合」反推组织条件,没有对新的注意力变体做消融。强化实验是受控反馈浓度,不是GRPO/PPO完整算法。论文几乎不讨论失败案例:8.57%预测错误落在哪类更新上、小模型结论能外推多远,主文没给。