TimelineBench:16 个 agent 做 56 项真实视频剪辑,最好仅通过 26.8%
ycombinator · x · 2026-10-02
arXiv 新论文提出 Timeline-Bench,专门评测 AI agent 完成真实视频剪辑长程任务的能力:从选择对白镜头、把采访素材剪成故事,到用产品镜头、配音和图形剪广告片。每个任务提供 brief、原始素材、容器与一组测试,输出须通过全部测试才算完成,质量测试基于 43 位剪辑师的 2,582 次盲评校准。
核心结果:
- 共评测 16 个搭配 Codex、Claude Code、OpenCode 等 harness 的前沿模型 agent
- 最好的 GPT-6 Astra + Codex(附编辑指导)也只完成 56 项中的 15 项(26.8%),平均仅 14.0%
- 人类剪辑师在 83.5% 的对比中更偏好参考剪辑
- 771 次未通过运行中有 562 次仅败在质量测试:agent 通过截图和转写感知素材,只检查渲染缺陷,缺乏「手艺」层面的判断
任务、verifier 与逐次运行结果均已开源。
「编程与Agent」频道最新
- AI agent 平台 OpenHands 宣布通过 SOC 2 Type II 合规认证 — rajistics · 2026-10-02
- Grady Booch:编码 agent 擅长写码,架构决策仍靠人类判断 — Grady_Booch · 2026-10-02
- Jev 提出「决策原语」:让模型跳过文本直接接入程序逻辑 — hardimanjames · 2026-10-02
- LangChain 联创:agent 核心模式一年未变,「我们已在 AGI 四个月」 — BraceSproul · 2026-10-02
- n8n 上线 typesafeai 的 Jev 模型,专做模糊条件路由判断 — hardimanjames · 2026-10-02
- Firecrawl 推出 People Enrichment Pack,让 Agent 查人查公司 — devdigest · 2026-10-02