TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos
Yifan Mei, Qingling Shi, Changli Wu, Jiayuan Rao, Jiayi Ji, Liujuan Cao
cs.CV
2026-08-13
厦门大学等提出TennisVAR与TRACE基准:先解析每拍触球事件,再按拍间图推理战术。证据定位T-F1@8达73.04,比最强监督微调基线高19.94。
网球视频理解长期走两条互不交接的路。TrackNet、F3Set 能把球拍触球钉到帧,也能标出击球人、线路、技术,但每拍当独立事件,讲不清前几拍怎么把后面的上网逼出来。TennisTV、TennisExpert 和通用多模态大模型能写解说、答战术题,依据却常常是回合结果或语言先验,结论钉在哪几拍上无法核查。
这篇把缺口收成 rally 级任务:击球证据落地的战术推理。给定一段对打视频和一句自然语言问题,模型要同时给出开放答案、三层战术标签、按时间排好的支撑击球,以及其中的关键动作。每一拍证据对齐到触球帧。评的不只是句子对不对,还评推理链能不能指回场上发生过的击球。
TRACE 把任务变成可测基准。它从 F3Set 的密时间戳网球事件往上扩到多拍战术和带证据的问答。片源覆盖大满贯、巡回赛、奥运会和团体赛的男女职业比赛:109 场、72 名球员、11,189 个 rally、41,485 次击球、25,429 个专家核定战术单元、11,189 道问答。划分按源比赛切开,训练、验证、测试为 7,119、1,805、2,265,同一场不会漏到两边。战术本体是 6、17、25 三层,覆盖发球、接发、底线构建、上网转换、防守反击,外加一类「无主战术」。问题分三档:事实感知 Q1 3,643 道、战术理解 Q2 6,376 道、决策推理 Q3 1,170 道。语言模型先提候选战术单元,三名网球专家用同一批样例校准后,每条至少两人复核。问答由多家模型独立出题,标注员在不知道生成模型身份的情况下改写,并标出最小支撑击球集和关键动作子集。球员身份一律改成镜头相对的 [Player Near] / [Player Far]。
TennisVAR 分三段算,论文叫它「事件、关系、证据、战术」。
事件解析模块 EPM 不把整段视频直接丢进大模型。它融合 DINOv3 外观、短时运动和 TrackNet 球轨迹,再用 F3Set 的 F3ED 编码器把连续画面收成有序击球:触球帧、融合视觉特征、击球人、技术、方向、结果。触球检测用连续目标的 focal 二分类交叉熵,属性损失只在标注触球点上算。后面的图推理全建在这串事件上,触球帧从这里继承,不再另预测。
战术图引导的时序推理器 TGTR 把每拍当成节点,连两类边:相邻击球的时间边,以及同一名球员隔着对手回球的决策边。关系条件消息传递再接 Transformer,得到拍级上下文和整段 rally 表示。问题进来后,两个头分别给「这拍是不是支撑证据」和「这拍是不是关键动作」打分。证据路由器用证据分加权,把整段表示、选中击球和问题融成一个向量,三个战术分类头都吃这个向量。训练不喂 oracle 击球编号,把标注证据帧和预测触球做一对一匹配,训练和推理都待在预测事件空间里。
最后才轮到语言模型。Qwen3-VL-8B 的预训练权重冻住,只训 rank-32 的 LoRA。输入是稀疏全局帧、选中触球附近的局部窗,外加一张序列化事件表。战术标签、证据拍、关键动作由 TGTR 出,语言模型只负责把已经带证据的结构写成答案和理由。训练用 8 张 NVIDIA H20 96GB。
零样本通用模型能写出流畅句子,但钉不准击球。GPT-5.5 的时间 F1@8 只有 37.03,时间 IoU@4 只有 24.54。TennisVAR 分别到 73.04 和 56.19。
相对最强监督微调基线,证据侧拉开更明显:
| 方法 | T-F1@8 | T-IoU@4 | 层次战术 F1 | 关键动作准确率 | 总分 |
| InternVL3-8B SFT | 53.10 | 23.16 | 59.91 | 44.75 | 44.81 |
| Qwen3-VL-8B SFT | 49.46 | 21.06 | 64.49 | 47.13 | 44.83 |
| TennisVAR | 73.04 | 56.19 | 70.98 | 52.27 | 57.11 |
T-F1@8、T-IoU@4、层次战术 F1 相对对应最强 SFT 分别高 19.94、33.03、6.08。文本指标只是小步:相对同底座的 Qwen3-VL-8B SFT,ROUGE-L、CIDEr、BLEU-4 只高 1.78、1.80、1.83。词面重合测不出答案有没有钉对击球。
按问题难度,Q1 事实感知上 TennisVAR 的 T-F1@8 到 83.50,Q2 战术理解 71.08,最难的 Q3 决策推理掉到 54.88,相对最强 SFT 仍高 14.71。消融里,拿掉 TGTR,总分掉 9.07、T-F1@8 掉 17.14、关键动作准确率掉 10.92;拿掉证据路由器,层次战术 F1 掉 10.18。EPM 三路输入里,去掉 DINOv3 总分掉 6.10 最多,去掉 TrackNet 或运动流,T-F1@8 分别掉 10.91 和 8.82。
对做体育视频或多模态视频问答的人,这篇把「说得像那么回事」和「能指出依据」拆开了。通用 MLLM 零样本在 TRACE 上证据定位接近不可用,直接微调 Qwen3-VL 也只能把 T-F1@8 做到 49.46。拉开差距的是先把击球收成离散事件,再用拍间图做问题条件的证据路由。
落地场景很窄:职业网球转播、需要可核查依据的战术问答或教练复盘。不是通用视频理解方案。语言生成几乎没改底座,收益也薄,值跟进的是事件图这条管线,不是又一个解说模型。
正文没有单独的局限节。数字自己把短板摊开了。关键动作准确率做到 52.27,刚过一半;帧级准确率 F-Acc@8 只有 47.86,触球帧对齐仍粗。Q3 只有 1,170 道,T-F1@8 比 Q1 低了 28.62,决策层还远没稳住。
数据全是职业转播、建在 F3Set 时间戳上,业余、多机位、遮挡严重的画面没测。球员只用镜头远近,不建模具体人的战术习惯。战术单元先由语言模型提案再专家审,问答也是模型出题人改写,标注分布可能带着生成模型的措辞偏好。训练堆了 8 张 H20 96GB,EPM、TGTR、LoRA 分段训,复现成本不低。项目页给了,领取记录里没有对应 GitHub。