StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang
cs.AI
2026-08-18
字节 Seed 联合多所高校发布 StartupBench,从 20 多个市场验证的 AI 创业产品反向提取 97 个端到端工作任务,9 个前沿模型在统一 harness 下平均分最高 73.67,按 90 分及格线算完成率无一超过三分之一。
Agent 基准有个共同软肋:题目是研究者想出来测能力的,不是用户真的花钱让 AI 干的活。GAIA、OSWorld 这些工作推进了真实性,但任务来源仍是研究者视角。后果是榜单分数与「能不能交付用户敢直接用的东西」之间隔着一段没人量过的距离。
这篇的做法是倒过来:先找市面上已经跑通的 AI 创业产品(融资超 100 万美元、有付费或规模用户),访谈 30 多个深度用户,搞清楚真实工作流和交付物长什么样,再让 50 多位领域专家把这些工作流改写成可复现的评测任务。筛选条件里有一条很关键:前沿模型试点跑起来轻松拿高分的任务直接剔除,保证区分度。最终 97 个任务、6 个领域(医疗 21、金融 18、法律 16、商业管理 19、STEM 与计算机 16、教育人文 7),输出物是 DOCX、XLSX、PPTX 这些真实交付格式。
评测设计有三个值得注意的决定:
9 个模型(闭源 GPT-5.6-sol、GPT-5.5、Gemini-3.1-Pro、Seed-2.1-Pro、Qwen-3.6-Max;开源 Kimi-K3、Kimi-K2.6、GLM-5.1、DeepSeek-V4-Pro),统一 harness,每模型 3 轮:
| 模型 | 平均分 | 完成率(≥90) |
| Kimi-K3 | 73.67 | 29.55% |
| GPT-5.6-sol | 73.61 | 31.27% |
| GPT-5.5 | 72.79 | 26.80% |
| Seed-2.1-Pro | 67.19 | 22.34% |
| DeepSeek-V4-Pro | 61.11 | 16.49% |
| GLM-5.1 | 60.79 | 16.49% |
| Kimi-K2.6 | 59.95 | 13.06% |
| Qwen-3.6-Max | 59.46 | 15.12% |
| Gemini-3.1-Pro | 49.73 | 6.53% |
几个结构性发现:
对做 agent 产品的人,这份基准回答了一个商业问题:通用模型今天能替代多少垂直 agent?数据给的答案是「远不能」。专用系统高出 oracle 通用设置 11.75 分,垂直玩家的护城河在数据里是真实的,而且论文把护城河拆解成了可攻关的具体能力清单:复杂指令全程遵从、领域合规、对成品的独立验证。这份清单比总分排名对研发更有用。
对选型的人,90 分及格线这个口径值得借用:连续平均分会让模型显得比实际能干,「能不能一次交付」才是用户视角的及格线。