Stanford 发布 Terminal-Bench-Science 基准

AlexGDimakis · x · 2026-09-02

Stanford 团队联合全球科研机构发布 Terminal-Bench-Science v0.1,包含 70 个任务,用于评估 AI Agent 在各学科科研工作流中的表现。测试显示 Claude Opus 5 仅解决约 30% 任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →