NVIDIA 发布 SWE-Serve:53 个任务测 agent 能否开发推理引擎
NVIDIAAI · x · 2026-09-24
NVIDIA 团队发布新基准 SWE-Serve,考察 AI agent 能否真正开发推理引擎并为真实模型提供服务。基准从 SGLang 的真实工程工作中提炼出 53 个任务,覆盖模型集成、公共 API、缓存系统与 GPU kernel 等方面。
任务构建流程严谨:每个任务取自 SGLang 的发布说明、roadmap issue 和维护者建议;作者(借助 coding agent 辅助)准备指令与测试,要求原仓库(no-op)必须无法通过新行为测试、参考解(oracle)必须全部通过,再经人工审查入库。评测时 agent 只能访问任务环境、模型端点和 Hugging Face,不能访问公共网络或上游仓库;隐藏的功能与回归测试只看补丁行为是否符合要求,而非是否与参考解代码一致。作者强调 live-serving 实测的必要性。
「编程与Agent」频道最新
- 开发者用 Claude Opus 5.5 以 Lean 形式化验证 Agent SDK,产出 16 个修 bug PR — bcherny · 2026-09-24
- Instinct 智能体网络上线一周协作超 30 万次,新增文件直传与邀请链接 — mon__lim · 2026-09-24
- Google 开源 AX:面向自主 AI 智能体的 Kubernetes 风格编排器 — rseroter · 2026-09-24
- Instinct 回应数据外泄质疑:系幻觉伪造专有名词,48 小时上线全量幻觉检测 — mon__lim · 2026-09-24
- Agent 之间互投广告的市场能成立吗?发帖人征集反方理由 — PenStreet9737 · 2026-09-24
- 没有用户怎么测 AI Agent?用模型生成真实查询先建 eval 集 — hugobowne · 2026-09-24