GPT-5 直出数据视频仅 2.13 分,多智能体编排拉到 3.89

DataMagic: Authoring Data Videos through Declarative Multi-Agent Orchestration

Yupeng Xie, Zhenyang Wang, Liangwei Wang, Jiayi Zhu, Zhouan Shen, Yuyu Luo

cs.HC, cs.AI, cs.DB, cs.MA

2026-09-27

港科广团队用声明式规范 DVSpec 加多智能体编排,把原始表格自动做成带解说和动画的数据视频,质量分较 GPT-5 直出提升 83%,执行成功率超 95%,用户任务时间省 79.7%。

这篇在解决什么

数据视频(data video)是动态图表、语音解说、同步动画配合而成的视频叙事形态,商业汇报和数据新闻里很常见,但制作要同时懂数据分析、叙事设计和视频剪辑。现有工具各卡一段:DeepEye、HAIChart 这类自动可视化系统出的是静态图,没有叙事和动画;WonderFlow、Data Playwright 这类创作工具能配解说和动画,但起点是已经做好的图,接不了原始数据;Sora、Veo3 这类像素级模型能端到端出片,数字却会幻觉,画面元素也追不回数据源。

让 LLM 一次推理直接写完整渲染代码行不行?论文测了,不行。109 个真实样本上,GPT-5 直出的质量均分只有 2.13/5,四个模型的执行成功率散布在 48.62% 到 86.24% 之间,典型故障是渲染代码跑挂后整段白屏。困难有两个:图表、解说、动画和它们的时间关系缺乏统一表示;洞察、图型、叙事顺序组成的设计空间太大,逐场景贪心生成必然重复或断裂。

方法

DataMagic 是港科大(广州)团队的开源系统,核心是一层声明式中间表示加一条两阶段智能体流水线。

DVSpec 把视频表示成 JSON 场景序列,每个场景是自包含的五元组(标识、类型、内容、解说、动画),自带图表配置和数据切片。两个机制解决老工具的顽疾:

Generate-then-Orchestrate 策略负责搜设计空间。生成阶段:Story Planner 把查询拆成相互正交的子任务,Data Manager 自动生成 Python 代码为每个子任务抽取微数据集,Visual Designer 并行设计图表,得到一池候选场景,此阶段刻意不写解说和动画。编排阶段:Narration Director 按「洞察价值+查询覆盖」挑场景,按叙事结构排序(默认 Freytag 金字塔,另有倒金字塔、对比式等),再用滑动窗口带着前后场景的上下文写解说;Animation Coordinator 把解说里提到的实体(产品名、日期、数值)绑定到对应视觉元素并设触发索引。成品约束在 60 到 120 秒、初始不超过 7 个场景。

DVSpec 同时是三层交互的共享状态:画布直接操作、脚本编辑、自然语言命令。任何编辑只改目标场景的字段、只重渲染该场景,其余视频不动。

结果

109 个样本来自 60 个真实数据集(36 个取自 T2R-bench,24 个取自 DAComp-DA,最大 15 万行),五个维度按 1 到 5 打分,由 Gemini-2.5-Pro 自动评分,并与 3 位专家在 60 个视频上的人工分对过(Pearson r=0.91)。

方法执行成功率平均分
GPT-5 直出86.24%2.13
Claude-Sonnet-4 直出84.40%2.18
DataMagic(GPT-5 底座)95.41%3.38
DataMagic(Claude-Sonnet-4 底座)98.17%3.89

涨幅最大的恰是直出最差的两个维度:动画平均从 1.84 到 4.03(+120%),叙事从 2.00 到 3.43(+72%)。直出失败集中三类:渲染崩溃白屏、截断遮挡等设计缺陷、解说与画面错位的「盲解说」;DataMagic 靠声明层绑定从设计上消掉了第三类。把最弱的 DeepSeek-V3.2 换进框架,执行成功率从 48.62% 升到 96.33%,框架不吃特定模型。代价是时间:直出约 57 秒,全流程约 176 秒,慢三倍换质量和稳定。

消融上去掉 Story Parser 之外的 Story Planner 均分降到 3.44,去掉全局编排降到 3.54;去掉编排后动画仍有 3.95(仅降 10%),音画同步靠 DVSpec 声明层,不依赖全局规划。

用户研究(N=12 被试内设计,基线是同一个 Claude Sonnet 4.5 的多轮对话工作流):完成时间从 39.2 分钟降到 8.0 分钟(-79.7%),NASA-TLX 六个负荷维度五个显著下降,叙事连贯性主观分 6.6 对 2.8。基线条件下 7 人超 40 分钟目标时长,DataMagic 条件下 12 人全部按时完成。

为什么重要

对做 BI 报表和数据叙事产品的人,这是从原始表格到成品视频的完整开源路径(React 加 Remotion,DVSpec 可单独复用)。更一般的启示:对要求精确与可追溯的任务,「结构化中间表示+分工智能体」明显压过端到端直出,这个模式正在多个领域重复出现。DVSpec 一边当智能体的协作接口,一边当人的可编辑状态,自动化产出可以局部修改而不必整体重跑,这是黑盒生成给不了的。它是一篇 HCI 与可视化系统论文,贡献在系统与交互设计,没有训模型。

局限与存疑

作者自列:只支持单表,不做多表 join;绑定 Remotion 单一渲染器;动画走结构化模板,动作语言保守,拿表现力换可靠;干预都发生在生成之后,分析方向的先期确认留待后续。附录的失败案例同样说明问题:极端数值分布会把饼图挤出画布,有一条案例解说念 40.6% 而画面标签是 40.9%,跨模态一致性有保障但不完美。

几点存疑:评分靠 LLM judge,虽与专家对过 60 个样本,各维度分差的稳健性仍待更大规模验证;用户研究只有 12 名硕博学生,基线选对话式工作流而非现有创作工具(论文的理由是那些工具要预制图表,不满足端到端设置);评测集由作者从两个 benchmark 自行拼装,这个领域还没有公开基准,跨系统可比性有限。

术语

原文与代码

相关论文

全部论文解读