ParaTempo: Efficient Parallel Reasoning via Temporal Confidence
Xuteng Zhang, Wenhao Zeng, Xiaodong Gu, Chao Hu, Haotian Lin, Yuling Shi, Min Wang, Beijun Shen
cs.AI
2026-08-17
ParaTempo把中间答案分布做滑动窗口聚合,得到时序置信度,用来异步剪枝、退休和分叉。相对self-consistency,延迟降21.8%–32.2%、token降18.1%–30.3%,Qwen平均准确率只差1.1个百分点。
并行推理同时跑多条解题轨迹再投票,能抬高大推理模型的正确率,但账单跟分支数和推理深度一起涨。常见做法是固定预算:所有链全部跑完再多数票。已经收敛的链还在吐冗余token,看起来没戏的链也占着算力。
现有的在线控制信号对不上这条需求。最终答案共识可靠,但要等很久才出现。token熵、困惑度盯的是下一个词好不好写,跟答案有没有稳住不是一回事。单次中间探测能早介入,中间步骤却会短暂偏向错误假设,信号抖。缺一个既对齐答案空间、又能跨时间看稳不稳、还能在单条分支上独立更新的量。
上海交大与宾大提出的ParaTempo是训练无关的异步控制器。每条活跃分支每生成500个token被探测一次:在当前推理前缀后接</think> Final answer:这类强制收答案后缀,取出top-20候选的概率,归一化成答案桶上的分布。再把最近W=7次探测做均匀平均,得到聚合分布g,时序置信度定义为exp(−H(g))。它接近1时,最近几次探测都挤在同一个答案上;散开时,有效竞争答案变多。
控制器用这一个信号管四件事。
全局停的条件是置信度加权投票里,主导答案拿到的质量总和≥0.50×投票分支数。各分支不必对齐到同一推理深度,没有宽度方向的同步栅栏。默认K=16,在vLLM、单卡A100 80GB上跑,四次平均。
基准是AIME 2026、HMMT 2025年11月、HMMT 2026年2月、GPQA Diamond。底模是Qwen3.5-35B-A3B和GPT-OSS-20B。
相对self-consistency(SC@16),Qwen上ParaTempo平均准确率71.1%,SC是72.2%,差1.1个百分点;延迟降21.8%,总token降30.3%。相对同步中间探测的Parallel-Probe,准确率高3.9个百分点,延迟低10.6%。GPT-OSS上相对Parallel-Probe高3.8个百分点;相对SC,延迟降32.2%、token降18.1%。
| 模型 | 基准 | ParaTempo 准确率/延迟 | SC 准确率/延迟 | Parallel-Probe 准确率 |
| Qwen | AIME26 | 83.3% / 198.4s | 87.5% / 250.6s | 76.7% |
| Qwen | HMMT25 | 73.3% / 205.7s | 69.2% / 257.8s | 65.0% |
| Qwen | HMMT26 | 42.4% / 208.0s | 45.5% / 254.8s | 42.4% |
| GPT-OSS | AIME26 | 86.7% / 79.3s | 90.0% / 110.6s | 81.7% |
无控制并行下超过9000万token的诊断:平均token熵的波动0.54,对未来答案稳定(h=5)的Spearman |ρ|只有0.13,AUC 0.58;token困惑度差不多(0.56 / 0.12 / 0.57)。瞬时答案置信度好一些(0.26 / 0.41 / 0.71),仍抖。HMMT25上Qwen消融:拿掉退休,准确率掉6.6个百分点到66.7%;拿掉分叉掉3.3个百分点,算力最低;拿掉剪枝,延迟升到233.0秒,准确率71.7%。
对已经在跑SC@16的推理服务,这是可以即插的训练无关控制器。它把「这条链还值不值得写下去」从最终投票提前到生成过程中,而且不要求各分支对齐。给的是少两到三成算力、准确率大体保住的操作点,不是再刷一个点的榜。
它也把控制信号的标准说清楚了:要对齐答案空间、要跨时间聚合、要分支本地。token置信度过滤(DeepConf)和同步中间探测(Parallel-Probe)在这套标准下都偏了。
正文没有单独的局限节。HMMT26上Qwen的ParaTempo准确率42.4%,和Parallel-Probe、零样本持平,低于SC的45.5%,时序控制在这套题上没换成正确率。探测依赖强制收答案后缀,任务得有可归一化的离散答案桶,开放式写作、代码补全不一定能直接搬。热身15次、间隔500 token,大约前7500 token不干预,短轨迹上的节省有限。探测本身的前向开销没有单独拆出来。对照只覆盖两个中等规模开源推理模型。