交大ParaTempo用时序置信度剪枝,并行推理延迟最多降32.2%

ParaTempo: Efficient Parallel Reasoning via Temporal Confidence

Xuteng Zhang, Wenhao Zeng, Xiaodong Gu, Chao Hu, Haotian Lin, Yuling Shi, Min Wang, Beijun Shen

cs.AI

2026-08-17

ParaTempo把中间答案分布做滑动窗口聚合,得到时序置信度,用来异步剪枝、退休和分叉。相对self-consistency,延迟降21.8%–32.2%、token降18.1%–30.3%,Qwen平均准确率只差1.1个百分点。

这篇在解决什么

并行推理同时跑多条解题轨迹再投票,能抬高大推理模型的正确率,但账单跟分支数和推理深度一起涨。常见做法是固定预算:所有链全部跑完再多数票。已经收敛的链还在吐冗余token,看起来没戏的链也占着算力。

现有的在线控制信号对不上这条需求。最终答案共识可靠,但要等很久才出现。token熵、困惑度盯的是下一个词好不好写,跟答案有没有稳住不是一回事。单次中间探测能早介入,中间步骤却会短暂偏向错误假设,信号抖。缺一个既对齐答案空间、又能跨时间看稳不稳、还能在单条分支上独立更新的量。

方法

上海交大与宾大提出的ParaTempo是训练无关的异步控制器。每条活跃分支每生成500个token被探测一次:在当前推理前缀后接</think> Final answer:这类强制收答案后缀,取出top-20候选的概率,归一化成答案桶上的分布。再把最近W=7次探测做均匀平均,得到聚合分布g,时序置信度定义为exp(−H(g))。它接近1时,最近几次探测都挤在同一个答案上;散开时,有效竞争答案变多。

控制器用这一个信号管四件事。

全局停的条件是置信度加权投票里,主导答案拿到的质量总和≥0.50×投票分支数。各分支不必对齐到同一推理深度,没有宽度方向的同步栅栏。默认K=16,在vLLM、单卡A100 80GB上跑,四次平均。

结果

基准是AIME 2026、HMMT 2025年11月、HMMT 2026年2月、GPQA Diamond。底模是Qwen3.5-35B-A3B和GPT-OSS-20B。

相对self-consistency(SC@16),Qwen上ParaTempo平均准确率71.1%,SC是72.2%,差1.1个百分点;延迟降21.8%,总token降30.3%。相对同步中间探测的Parallel-Probe,准确率高3.9个百分点,延迟低10.6%。GPT-OSS上相对Parallel-Probe高3.8个百分点;相对SC,延迟降32.2%、token降18.1%。

模型基准ParaTempo 准确率/延迟SC 准确率/延迟Parallel-Probe 准确率
QwenAIME2683.3% / 198.4s87.5% / 250.6s76.7%
QwenHMMT2573.3% / 205.7s69.2% / 257.8s65.0%
QwenHMMT2642.4% / 208.0s45.5% / 254.8s42.4%
GPT-OSSAIME2686.7% / 79.3s90.0% / 110.6s81.7%

无控制并行下超过9000万token的诊断:平均token熵的波动0.54,对未来答案稳定(h=5)的Spearman |ρ|只有0.13,AUC 0.58;token困惑度差不多(0.56 / 0.12 / 0.57)。瞬时答案置信度好一些(0.26 / 0.41 / 0.71),仍抖。HMMT25上Qwen消融:拿掉退休,准确率掉6.6个百分点到66.7%;拿掉分叉掉3.3个百分点,算力最低;拿掉剪枝,延迟升到233.0秒,准确率71.7%。

为什么重要

对已经在跑SC@16的推理服务,这是可以即插的训练无关控制器。它把「这条链还值不值得写下去」从最终投票提前到生成过程中,而且不要求各分支对齐。给的是少两到三成算力、准确率大体保住的操作点,不是再刷一个点的榜。

它也把控制信号的标准说清楚了:要对齐答案空间、要跨时间聚合、要分支本地。token置信度过滤(DeepConf)和同步中间探测(Parallel-Probe)在这套标准下都偏了。

局限与存疑

正文没有单独的局限节。HMMT26上Qwen的ParaTempo准确率42.4%,和Parallel-Probe、零样本持平,低于SC的45.5%,时序控制在这套题上没换成正确率。探测依赖强制收答案后缀,任务得有可归一化的离散答案桶,开放式写作、代码补全不一定能直接搬。热身15次、间隔500 token,大约前7500 token不干预,短轨迹上的节省有限。探测本身的前向开销没有单独拆出来。对照只覆盖两个中等规模开源推理模型。

术语

原文与代码

相关论文

全部论文解读