Project Greenhouse: Progress Toward Fully Open and Sovereign Agentic Search
Jimmy Lin, Sahel Sharifymoghaddam, Lingwei Gu, Nour Jedidi
cs.IR, cs.CL
2026-10-08
不用第三方开源底座,从零预训练加微调两步训出 3B reranker,TREC DL/BEIR 均值 nDCG@10 达 0.641/0.547,超过所有微调基线,仅逊 GPT-6.1 Sol。
做 reranker 的默认路径,是拿 Qwen、Gemma 这类开源权重底座灌一批相关性标注微调。省事,但供应链握在别人手里:底座的预训练语料、数据配比、对齐流程全不公开,你拿到的是权重,不是来历。数据合不合规、有没有预埋偏见或后门都无从审计,想换数据配比重训一遍也做不到。论文引用 2026 年 6 月 Anthropic 按美国政府指令暂停 Fable 5 访问又恢复的事件作提醒:关键能力被单方面切断不是假想风险。
滑铁卢大学 Jimmy Lin 团队的 Project Greenhouse 要验证一个命题:只用公开数据和适量算力,能否端到端、自己掌控地训出有竞争力的搜索模型。首个里程碑选 pointwise reranker,理由很实际:一对(query, 文档)进、一个分数出,接口简单迭代快;单独可用,任何检索管线随插随用;也是通往 agentic search 的台阶,可当相关性判官或 RL 的奖励信号。
两步,中间没有指令微调和对齐,不用教师模型,不用合成数据。
从零预训练。底座照抄 Karpathy 的 nanochat depth-34 配置:34 层 decoder-only Transformer,2048 token 上下文,共 3.29B 参数。其中 1.21B 是 value embedding 查找表,几乎不耗算力,每 token 计算量约等于 2B 稠密模型。语料是公开的 ClimbMix,完整一遍 287B token。优化器照抄 nanochat(Muon 管权重矩阵,AdamW 管 embedding),唯一实质改动是 batch size 调度:从 26 万 token 起步,训练中三次翻倍到约 210 万,峰值学习率全程不动。逻辑是训练早期模型很弱,小 batch 已能指明更新方向、更省数据;后期 batch 信噪比下降,加大 batch 本身就起到学习率衰减的作用。硬件是一台 8 卡 H100 服务器,FP8 矩阵乘,全程约 1600 GPU 小时。
监督微调。prompt 为「Query: {query} Passage: {passage} Relevant:」,相关性分数取下一 token 中 true 与 false 的 logit 差,输出层只保留这两行,参数降到 3.22B。数据用 RLHN-250K,约 24.7 万条 query-文档相关性对;损失用 LCE,对同一 query 的一个正例加 K 个难负例做 softmax。微调一个 epoch,单卡可跑。同一配方独立跑四次,四个 checkpoint 逐参数平均成 model soup,作为发布版 Gaggle。
论文还给了个定义工具:把 LLM 训练形式化成有向属性超图,节点是产物(语料、权重),边是计算(配方加配置)。一个模型「fully open and sovereign」当且仅当向上追溯的所有节点和边全部公开。按这个标准,一切从不公开预训练过程的 open-weight 底座微调来的模型都不合格。
nDCG@10(衡量前 10 名里相关文档的加权命中),统一重排 BM25 top-100 候选:
| 方法 | 类型/规模 | TREC DL 均值 | BEIR 均值 |
| BM25 | 一阶段基线 | 0.393 | 0.398 |
| Gaggle(本文) | pointwise 3B | 0.641 | 0.547 |
| MonoT5 | pointwise 3B | 0.604 | 0.520 |
| Qwen3-Reranker | pointwise 4B/8B | 0.615 / 0.605 | 0.541 / 0.541 |
| RLHN Qwen2.5 | pointwise 3B | 0.615 | 0.520 |
| Jina-Reranker-v3 | listwise 0.6B | 0.611 | 0.511 |
| Gemma-4 | listwise 26B,零样本 | 0.637 | 0.548 |
| Qwen3.8 | listwise 27B,零样本 | 0.633 | 0.554 |
| GPT-6.1 Sol | listwise 前沿模型 | 0.653 | 0.572 |
| Oracle | 重排上界 | 0.789 | 0.735 |
Gaggle 在全部 12 个集合上都超过 BM25,两组均值压过所有微调基线;TREC DL 只输 GPT-6.1 Sol,BEIR 低于 Sol 和 Qwen3.8、与 Gemma-4 打平。单看 DL19 拿 0.757,是含 Sol(0.750)在内的非 oracle 最高分;TREC-COVID 上也高于 Sol。四次运行给出噪声标尺:均值标准差约 0.001、单集合约 0.003,更小的差距按噪声处理。soup 比四次运行均值高 0.001/0.003,增益在噪声边缘。
两个附带发现比主结果更有信息量。其一,底座通用能力并不强:CORE 0.458、MMLU 0.493,低于表内几乎全部用 1.7T 到 34T token 训出来的模型,做 reranker 却够用。其二,通用能力更强的 Gemma-4-E2B、MiniCPM5 套同一微调配方,效果反而更差(Gemma BEIR 0.537 对 0.544)。排查发现是学习率问题:AdamW 训出的底座权重尺度只有本文 Muon 底座的约五分之一,5e-5 的峰值对它们过大,loss 到峰值不降反升;降到 1e-5 后 MiniCPM 的 BEIR 到 0.551,反超 Gaggle。共享配方直接横评底座会误判,学习率得跟着权重尺度调。数据侧还有一条:只用 MS MARCO 训练时 BEIR 掉到 0.470,多源混合撑住了域外泛化。
这是一份可行性证明:不借第三方底座、不蒸馏,一台 8 卡 H100 跑约 200 小时加单卡微调,得到与 26B/27B 零样本重排、专用 Qwen3-Reranker 同档的 reranker,学术组复制得起。语料、代码、配置、沿途每个 checkpoint 全部公开,数据出问题可以删掉重训,这种干预选项在 open-weight 模型上不存在。对研究本身,从零训练意味着能在预训练数据上做受控干预,「模型知道的东西从哪来」这类黑盒底座上做不了的实验,只有这条路做得成。
冷水也要泼:作者自己定位是 existence proof,不归因任何单一因素;MiniCPM 调完学习率在 BEIR 反超,说明从零训是主权最优路径,不是效果最优路径;2048 token 上下文也限制了长文档场景的直接使用。
作者自己承认的:对比模型在规模、数据、训练与推理方式上各不相同,优势无法归因到任何单一设计;基线与对照实验都没做超参搜索;范围只有 pointwise reranking,离 agentic search 还远;通用能力不与前沿模型竞争。
读下来另有几点。BEIR 七个集合里 SciFact、SCIDOCS、FiQA 与微调数据 RLHN-250K 同源,论文只把另外四个算域外,均值里有三个集合是域内成绩(对比的 RLHN 基线吃同一数据家族,横评仍算公平)。「无教师、无合成数据」要打个折:RLHN-250K 构建时用 LLM 重标过假负例,标签本身带模型痕迹,论文对这类边界有专门讨论且明说没下结论。model soup 的增益在噪声量级,当稳定化技巧看更合适。1600 GPU 小时在业界不算大,对多数实验室仍是要申请的预算,「几块 GPU」是相对前沿实验室说的。