TennisVAR 让 AI 从看懂动作到复盘战术,击球证据定位远超 GPT
量子位 · wechat · 2026-08-20
厦门大学、上海创智学院、上海交通大学团队提出 TennisVAR,针对体育多模态模型「说得像但没看懂」的问题,让 AI 在网球视频中沿击球链条还原战术逻辑,并给出支撑结论的具体击球证据。
- 新任务与数据集:提出「基于击球证据的战术推理」任务,构建 benchmark TRACE——11189 个回合视频、41485 次击球、25429 个战术单元,覆盖 109 场职业比赛、72 名球员;要求模型输出回答、分层战术标签、击球序列、关键击球与推理,且证据须定位到触球帧。
- 方法:Event→Relation→Evidence→Tactic 架构。事件解析模块融合 DINOv3 视觉特征、短时运动特征与 TrackNet 球轨迹;战术图时序推理模块把击球建为节点,连接时序关系与同球员连续决策关系。
- 结果:GPT-5.5 零样本 T-F1@8 仅 37.03,TennisVAR 达 73.04(T-IoU@4 为 56.19 vs 24.54);较最强 SFT 基线在 T-F1@8 再提升 19.94 个百分点。消融显示去掉图推理模块后 T-F1@8 大降 17.14 个百分点,证明结构化建模是关键。
论文:arxiv.org/abs/2608.12920,代码已开源。
「多模态」频道最新
- 粘土动画版《侠盗猎车手:圣安地列斯》 — ShaKodemon · 2026-08-20
- Runway 公布“不存在产品”广告大赛 15 位获奖者 — Kyrannio · 2026-08-20
- AI 生成:电影感十足的《DayZ》 — blufattanza89 · 2026-08-20
- AI 生成:日式玉子烧烹饪视频 — Independent-Arm-7397 · 2026-08-20
- 1 秒识别!AI 听歌识曲速度惊人 — No_Tower_ai · 2026-08-20
- Krea 2 生成像素风游戏关卡效果惊艳 — Neggy5 · 2026-08-20