0.63M 参数验证器媲美 7B 模型,AI 推理新极限
jm_alexia · x · 2026-08-21
这项研究探讨了“验证器”模型能做到多小。通过预训练一系列微型模型(最小至 7 万参数),发现仅需 0.63M 参数的模型(在一张 H100 上训练约 2 分钟)即可在特定任务上达到与 7B 模型相当的验证效果。
主要发现:
- Countdown 任务:0.85 分数的最小验证器仅需 0.63M 参数。
- Faithfulness 任务:2M 参数模型(得分 0.83)优于 Gemini 的 Zero-shot 表现(0.70)。
- 实验规模:涉及 19 个模型(11 个从头训练)、3.5B tokens 及 30 GPU-hours。
任务设置:
- Countdown:数字谜题,可精确校验。
- Maze:最短路径判断,可精确校验。
- Faithfulness:判断答案是否有来源支持,无精确 checker,需依赖人工标签并对比前沿 API 模型。
研究旨在解决大规模语料训练中,验证器遍历所有 token 造成的性能瓶颈,为多步推理或智能体集群的快速验证提供新思路。
「模型」频道最新
- Reddit 讨论:递归元提示让 Qwen 按任务分层思考,省一半推理 token — Rare_Potential_1323 · 2026-08-21
- NVIDIA 公布 Qwen3.8-2.4T 模型部署方案:GB300 显卡吞吐超 4000 tokens/s — PyTorch · 2026-08-21
- 实战教程:通过继续预训练让本地 LLM 学习新领域 — funJS · 2026-08-21
- Qwen 3.8 27B两次对话就写出可玩3D游乐园,量化版也能打 — RandumbRedditor1000 · 2026-08-21
- 智谱 SAO 论文:单采样异步 RL 稳定训练千步,超越 GRPO — teortaxesTex · 2026-08-21
- Gemini 安全审查过严?连亲吻和公路拍照都拒 — Dry-Sympathy-3182 · 2026-08-21