SWE Odyssey 基准测试验证长周期 Agent 能力
garrytan · x · 2026-08-15
SWE Odyssey 是一个新的标准化基准,旨在解决现有基准逐渐饱和的问题。它旨在量化测试一个更大的命题:智能体能否在数小时内自主工作并正确构建目标产物。该基准属于超长周期评估体系的一部分。
「编程与Agent」频道最新
- Teknium 称自己被 Agent 杠杆率过高 — nickbaumann_ · 2026-08-15
- GraphJin宣称用小型廉价模型驱动整个组织,Agent harness成关键 — dosco · 2026-08-15
- Anthropic 分享构建高性价比 Agent 的技巧 — brada · 2026-08-15
- Actual 即将集成 Hermes:开箱即用的本地 Agent 工作站 — markjeffrey · 2026-08-15
- Agora:专为AI智能体打造的文本开放世界游戏,通过MCP协议交互 — Own_Assistant_2511 · 2026-08-15
- 修复并改进 Qwen 3.8 聊天模板:解决推理与工具调用问题 — Chromix_ · 2026-08-15