小红书开源 Iris:35B 搜索智能体逼近万亿参数级模型
小红书技术REDtech · wechat · 2026-09-14
小红书 AllSpark 团队发布并开源搜索智能体 Iris(权重与评测代码,论文 arXiv:2609.04304),在 BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE 四个 Agentic Search 基准上取得同量级最强开源成绩:Iris-mini(35B)四项 82.2/84.8/86.9/52.3,BrowseComp 上逼近 Kimi-K2.6 等万亿参数模型;Iris-pro(397B)88.6/85.1/92.9/56.4,三项登顶且搜索能力外溢到 General ToolUse 与 Cowork 场景。
数据:不从收集而是从网页超链接结构反向造题——种子页面出发聚实体图谱、编写需跨页多步推理的唯一答案问题、把题面实体改写成描述性指代以杜绝字符串匹配捷径;再用参考模型双重筛选「闭卷答不出、给证据能答对」。全自动、可随语料规模扩展。
训练:SFT–RL Climbing 交替。SFT 用强教师模型轨迹,轨迹层过滤 + 数据归纳标准的单轮「判官」剔除瞎搜步骤。RL 阶段在真实网络边搜边学,两个关键工程决定:判分与摘要收进训练集群内部(自建模型兼任奖励判官与摘要器,不依赖外部 API);超长轨迹请求级断点续跑,保 GPU 忙碌。每轮 RL 后把最难与最高效轨迹回灌 SFT,形成自适应课程。
评测:统一 Tool/Context/Judge、单 ReAct 智能体、不叠多智能体与测试时自我验证;对照发现关闭上下文管理(CM)时 Iris 仍领先,开启后小模型获益大于大模型。团队坦承与最顶尖前沿系统仍有差距。
「编程与Agent」频道最新
- Devin 原生录屏展示测试过程,云优先设计显优势 — brandon_galang · 2026-09-21
- 用 LLM 替代高斯过程做贝叶斯优化,博主实测四种方案 — tak3sh8 · 2026-09-21
- 实测 JEV:用英语描述任务,秒级生成跨数百应用的工作流 — gaganghotra_ · 2026-09-21
- Agent Experience 成新议题:你的用户里已经有 Agent 了 — YvesMulkers · 2026-09-21
- Anacondahood 上线:conda 研究 + Robinhood MCP 执行 + 链上三轨交易生态 — teoliphant · 2026-09-20
- 15 分钟、10 美分:用 Jev 判断模型让纯视觉无人机穿越障碍赛道 — alex_verem · 2026-09-20