NVIDIA 发布 SWE-Serve:53 个任务测 agent 能否开发推理引擎

NVIDIAAI · x · 2026-09-24

NVIDIA 团队发布新基准 SWE-Serve,考察 AI agent 能否真正开发推理引擎并为真实模型提供服务。基准从 SGLang 的真实工程工作中提炼出 53 个任务,覆盖模型集成、公共 API、缓存系统与 GPU kernel 等方面。

任务构建流程严谨:每个任务取自 SGLang 的发布说明、roadmap issue 和维护者建议;作者(借助 coding agent 辅助)准备指令与测试,要求原仓库(no-op)必须无法通过新行为测试、参考解(oracle)必须全部通过,再经人工审查入库。评测时 agent 只能访问任务环境、模型端点和 Hugging Face,不能访问公共网络或上游仓库;隐藏的功能与回归测试只看补丁行为是否符合要求,而非是否与参考解代码一致。作者强调 live-serving 实测的必要性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →