XYZAILab 推出 35B 与 397B DeepSearch 智能体,验证 AI4AI 研发闭环
机器之心 · wechat · 2026-07-25
XYZAILab 发布了什么
- XYZAILab 发布了两款 DeepSearchAgent:XYZ-Aquila-mini(35B) 和 XYZ-Aquila-pro(397B)。
- 官方称它们在多项 DeepSearch 基准上刷新了 SOTA。
核心不只是模型,而是 AI4AI 研发范式
- 这次工作的重点是 AI4AI:让 AI 参与构建、调试和改进 AI 系统本身。
- 团队用时两个月,动员 10 余名研究者、约 千卡级等效算力 和 300+ Agent Workers,把任务构造、训练、运行时优化和评测整合进一个闭环。
- 研发流程由人类定义目标、规则、预算和验收标准;Agent 负责拆解任务、跑实验、提方案、记日志,但不能自定规则或自批发布。
方法和结果
- 系统使用了 append-only audit log、可见状态重建、state-faithful SFT、独立评测器和门控机制等设计。
- AI 还从失败轨迹中提出了新的工程想法,比如主动上下文整理和“研究记事本”式工作区。
- XYZ-Aquila-mini 在七项公开基准上取得领先;XYZ-Aquila-pro 在部分榜单上拿到最高公开分,并在 DeepSearchQA 上追平 Kimi-K2.6。
这件事意味着什么
- 这份工作展示了:AI 可以驱动 AI 研发闭环,但前提是有明确边界和独立验证机制。
「编程与Agent」频道最新
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11