BAAI 发布研究智能体 AREX:逐条核验答案,BrowseComp 达 82.5%
DeepLearningAI · x · 2026-10-09
北京智源研究院推出 agentic 研究模型与框架 AREX,核心思路是把对候选答案的通过/拒绝判断改成逐条需求核验的迭代循环:保留已验证的部分,把未满足的需求作为下一轮定向搜索的起点。
- 方法:构建 agentic harness,让智能体反复执行「收集证据→反思暂定答案→针对性补充搜索」;基于 harness 产出数据微调 Qwen3.5-4B 与 Qwen3.5-122B-A10B(混合专家)两个模型。
- 成绩:BrowseComp 82.5%,WideSearch-en F1 82.0%;仅 harness 本身即可带来最多 +10 分提升。
- 亮点:微调后的 4B 模型在 6 个基准中的 5 个上胜过未微调的 35B 模型,说明「harness + 针对性微调」比堆参数更有效。
「编程与Agent」频道最新
- 换 harness 不换模型,GPT-5.6 仓库迁移成绩从 6.5% 飙到 31% — omarsar0 · 2026-10-09
- 用 Opus 5.5 做出野火分析工具:可视化火势演进、无人机追踪热点 — natesiggard · 2026-10-09
- 「专家型子代理」或成新赛道:Harvey 类专业能力变成一次工具调用 — nbaschez · 2026-10-09
- WebMCP 冲击广告模式:LLM 代理只取信息不给点击 — ConnectRub4818 · 2026-10-09
- Grok Bot 线下聚会现场:观众投票点题,10 分钟生成可上线地图应用 — pswider · 2026-10-09
- 亚马逊AGI实验室:80%可靠性的Agent为何还不够用 — AI Engineer · 2026-10-09