字节发布 StartupBench:顶级模型完成率仅 30%

ByteDance-Seed · hf · 2026-08-19

字节跳动发布 StartupBench 基准,在真实创业工作流上测试通用 Agent。结果显示,即使是顶级模型也只能完成约 30% 的任务,暴露了指令遵循和领域专业知识的差距。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →