多车自动驾驶赛车:采样加博弈规划 95% 胜率,单步 0.095 秒

SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing

Zhouheng Li, Fangguo Zhao, Mattia Piccinini, Baha Zarrouki, Yuan Gao, Zitong Shan, Johannes Betz, Chen Lv, Lei Xie

cs.RO

2026-07-28

把博弈论的迭代最优响应改成 GPU 并行采样,再用 game-aware 代价排序加硬约束筛可行轨迹,多车赛车拿到 95.24% 胜率,单步 0.095 秒,比 IBR-MPC 快约 20 倍。

这篇在解决什么

多车自动驾驶赛车要实时规划,既要会超车、会防守、会卡位,又要在几十毫秒内算完。现有规划器各有各的短:有限状态机(FSM)要专家手写行为模式、调一堆参数;MPC 类方法在贴身缠斗时对初值敏感、算时忽长忽短;学习方法可解释性差、跨场景泛化不行;MPPI 这类采样方法只用软代价避碰,没有硬可行性检查,轮对轮时容易选出会撞的动作。

根本矛盾是「策略多样性」和「算得快」难以兼得。这篇的 SGTP(Sampling-based Game-Theoretic Planning)想两头都拿。

方法

SGTP 把博弈论里的迭代最优响应(Iterative Best Response, IBR)拆开重做。IBR 原本是:每辆车轮流把对手轨迹当成已知的固定量,求自己这一步的最优响应,反复迭代到收敛。问题是每一步最优响应本身是个优化,算起来慢。

SGTP 把这个最优响应子问题换成 GPU 并行的控制序列采样:一次采 K=128 条控制序列,用运动学自行车模型做前向 rollout 出 128 条轨迹,再用一个 game-aware 代价给它们排序。这个代价专门设计来产生多样的竞争行为,四项相加:

排序之后是关键的一步,硬可行性筛选。MPPI 是把避碰写进软代价,SGTP 则显式检查每条候选轨迹:赛道边界最小间距 ρbd 是否够、和障碍最小间距 ρobs 是否够,两条都过才算可行。代价最低的那条可行轨迹被选中。一条可行的都没有时,回退到「违反最小」的策略,选综合越界最小的。这让 SGTP 在策略切换时也能保证安全和可靠。

参数:K=128,时域 H=12(1.2 秒),IBR 迭代 2 轮,之后 ego 车再做一次额外最优响应。

结果

在 MapZoo 的 7 条赛道上,每条 6 个起始位,一个 ego 两个对手,最长 50 秒,共 42 场。对比 8 个文献基线(采样格点、End2Race、CFM、FSM、EVO-MPCC、标准 MPPI、Biased-MPPI、IBR-MPC):

指标SGTP对比
胜率95.24%EVO-MPCC 92.86%、IBR-MPC 85.71%
无碰撞胜率100%无公开可比
单步计算时0.095 秒(std 0.004)EVO-MPCC 0.860 秒、IBR-MPC 1.903 秒
任务完成率99.35%(均长 49.67s/50s)无公开可比

换算一下,SGTP 比 EVO-MPCC 快约 9 倍、比 IBR-MPC 快约 20 倍,同时胜率更高。

消融把功劳归清楚:去掉 game-aware 代价(只留跟踪代价),胜率掉到 50%、无碰撞胜率 14.29%;把 game-aware 代价塞进标准 MPPI(GA-IBR-MPPI),胜率 57.14%、无碰撞胜率 0%,说明采样加硬约束这套组合才是关键,光有 game-aware 代价不够。

扩展性上,从 2 辆加到 10 辆车,SGTP 计算时仍低且方差小、全程无碰撞;IBR-MPC 随车数增加算时和方差都涨,密集场景还会撞。鲁棒性上,对手轨迹预测受到扰动时(轻度、重度),SGTP 仍保持 94%–97% 无碰撞胜率。

代码、基线、评测平台都开源了,项目页 sgtp-racing.github.io。

为什么重要

对做自动驾驶规划或机器人实时决策的人,这篇给了一个把「博弈论最优性」和「采样规划的速度加硬安全约束」拼到一起的干净范例。思路可迁移到任何多智能体、强交互、又要硬避碰的实时场景(密集交通、多机器人协调)。开源基准本身也有价值,多车赛车之前缺统一的对比平台。

要泼一盆冷水:这是控制与优化方法,不是学习方法,所以它不「学」对手风格,对手轨迹预测目前是固定的;实验全在 F1TENTH 仿真里,没有上车实测。

局限与存疑

game-aware 代价的四项权重(wcontest、wlong、wblock、wsafety = 1.0、2.0、10.0、50.0)是手调的,作者承认未来要减参数调参负担。对手预测用固定轨迹,他们自己列为局限,计划引入基于世界模型的对手风格识别来改进。10 辆以上的可扩展性没测。全部结果都在 F1TENTH Gym 仿真,没有真实车辆验证,而赛车场景的接触和极限动力学在仿真和实车之间差距不小。game-aware 代价的权重是否在不同赛道、不同车型间可迁移,也没验证。

术语

原文与代码

相关论文

全部论文解读