In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing
Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi, Federica Sarro
cs.SE
2026-07-17
访谈 6 国 9 家自动驾驶公司的测试专家:当前主靠场景法与 X-in-the-loop,最大痛点是仿真保真度与场景真实性,且行业几乎没有可对标的公开基准。
自动驾驶系统(ADS)在快速上车,但「怎么测、测到什么程度算过」这件事,行业里并没有公认的标准。选哪些场景、看哪些指标、达到什么验收线,各家公司各干各的。已有的研究大多只盯一个切面(某种测试技术、某类挑战),缺少一份从一线测试工程师视角出发的全景。
这是一项访谈研究:找了 6 个国家、9 家公司里直接做 ADS 测试的 9 位专家(系统分析师、首席工程师、测试员、产品工程师、研发主管),每人 45–75 分钟半结构化访谈,再用主题分析法编码。9 家里 7 家是万人以上的车企,覆盖中国、瑞典、德国、英国、日本、比利时。产出是当前实践、共性痛点、解法方向,以及一个「以证据为中心的闭环测试框架」。
受访公司当前的主流测试范式是场景法加 X-in-the-loop,也就是在不同环节把不同部件换成仿真:
指标层面,「场景覆盖率」被多位专家认为是最重要的;其次是碰撞相关指标(泊车系统尤其看重)、舒适度(转向顺滑、刹车不突兀)、成功率(有公司要求泊车位识别在发布前达到约 95%)、故障率。验收线也很具体:有公司说公开路测跑 300 公里、准确率须过 90% 才放行。
没有跑分表,但痛点的集中度本身就是结果。受访者反复指向几个:
一位专家对「里程」这个指标有句很准的话:不是所有里程都一样值钱,反复绕同一条闭环路线,和遇到各种真实情况,完全是两回事。还有人点出行业潜规则:供应商倾向把产品宣传成 L2/L2+/L2++,哪怕体验已经接近 L3、L4。
解法方向基本围着 AI 转:用 3D Gaussian Splatting 做实时场景重建提升仿真质量;用端到端架构去掉感知和规划之间的显式接口;用世界模型直接仿真传感器数据;用大模型基于真实数据生成场景;用云端持续改进解决数据搬运。
最有产出的部分是那个「以证据为中心的闭环测试框架」,分六步:定义安全主张与测试意图(用 GSN 这类目标结构化标记)、构建并维护场景库、规划证据产出与测试环境路由(决定走 MIL/SIL/HIL/VIL)、设证据门与验收标准、构建安全论证决定是否推进或发布、从运营中闭环学习并把数据喂回测试。框架的核心主张是测试不能只靠堆里程,要建一条可追溯的证据链,每一步都为「系统在哪些情况下安全」累积可核实证据。
对做自动驾驶感知、规划、仿真的从业者,这份研究的价值是「行业在焦虑什么」。sim-to-real、场景真实性、世界模型、端到端,这些目前在学术界火热的方向,在工业测试一线恰好对应着最痛的几个点。如果你的工作能直接减小仿真差距或让生成场景更可信,业界有真实需求在等。
这是一份 9 公司 9 人的定性研究,样本不算大,且明显偏欧洲和中国车企,美国玩家(Waymo、Cruise 一类)的声音缺位,而恰恰是这些公司在公开基准和里程数据上走在最前。作者联系了 21 家只来了 9 家,存在自选择偏差,愿意接受访谈的可能本就更关注流程规范。访谈只反映受访者陈述,没有实地核对各家真实流程。框架本身是综合访谈归纳出来的,目前没有在真实项目里验证过它是否真能提升测试效率或安全性。