字节发布 StartupBench:顶级模型完成率仅 30%
ByteDance-Seed · hf · 2026-08-19
字节跳动发布 StartupBench 基准,在真实创业工作流上测试通用 Agent。结果显示,即使是顶级模型也只能完成约 30% 的任务,暴露了指令遵循和领域专业知识的差距。
「编程与Agent」频道最新
- Vercel KMS发布:在函数中安全签名JWT,私钥永不暴露 — cramforce · 2026-08-19
- 跳过数据映射导致幻觉,Billing Agent 实战复盘 — Div_pradeep · 2026-08-19
- AI Agent 真正落地生产了吗?还是只是炒作 — whatsnextintech007 · 2026-08-19
- Qwen Code v0.21.14 发布:新增会话管理与 Advisor 命令 — qwen-code-ci-bot · 2026-08-19
- a16z 合伙人盛赞 Grok Bot:自动化 25% 日常 — chaitu · 2026-08-19
- 开源 Stop-slop 技能,教你消除 AI 写作“机器味” — tom_doerr · 2026-08-19