XYZAILab 推出 35B 与 397B DeepSearch 智能体,验证 AI4AI 研发闭环
机器之心 · wechat · 2026-07-25
XYZAILab 发布了什么
- XYZAILab 发布了两款 DeepSearchAgent:XYZ-Aquila-mini(35B) 和 XYZ-Aquila-pro(397B)。
- 官方称它们在多项 DeepSearch 基准上刷新了 SOTA。
核心不只是模型,而是 AI4AI 研发范式
- 这次工作的重点是 AI4AI:让 AI 参与构建、调试和改进 AI 系统本身。
- 团队用时两个月,动员 10 余名研究者、约 千卡级等效算力 和 300+ Agent Workers,把任务构造、训练、运行时优化和评测整合进一个闭环。
- 研发流程由人类定义目标、规则、预算和验收标准;Agent 负责拆解任务、跑实验、提方案、记日志,但不能自定规则或自批发布。
方法和结果
- 系统使用了 append-only audit log、可见状态重建、state-faithful SFT、独立评测器和门控机制等设计。
- AI 还从失败轨迹中提出了新的工程想法,比如主动上下文整理和“研究记事本”式工作区。
- XYZ-Aquila-mini 在七项公开基准上取得领先;XYZ-Aquila-pro 在部分榜单上拿到最高公开分,并在 DeepSearchQA 上追平 Kimi-K2.6。
这件事意味着什么
- 这份工作展示了:AI 可以驱动 AI 研发闭环,但前提是有明确边界和独立验证机制。
「编程与Agent」频道最新
- GitHub 截图用 41 个子智能体和 15 万行改动玩梗 — zeeg · 2026-07-25
- Anthropic 把 agent 记忆做成可导出可审计的文件 — VraserX · 2026-07-25
- 作者称“写代码从来不是软件工程师的工作” — gdechichi · 2026-07-25
- Etched 称推理要做全栈,不只是写 kernel — AccBalanced · 2026-07-25
- 开源 TokenShield 用轮次哈希拦住 CrewAI 重试死循环 — bulleykebaal · 2026-07-25
- Abacus AI 的 xHigh agent 会在 Opus 5 和 GPT 5.6 Sol 间路由 — bindureddy · 2026-07-25