Gemini 训练细节曝光:组级奖励重分配对抗 reward hacking
nrehiew_ · x · 2026-09-23
nrehiew 对某前沿模型(从 Flash/Pro 命名看应为 Gemini)技术报告的长线程解读,重点在数据与 RL 工程:
- 架构极简:与 DeepSeek 不同,采用 vanilla 架构:SWA + MoE(无共享专家);预训练两阶段(先纯文本后全模态),Flash 训练 48T tokens(26T 文本 + 22T 全模态),Pro 为 30T(27T 文本 + 3T 全模态);mid-training 聚焦 agent 轨迹数据并扩展到 1M 上下文,使用带行范数控制的 Muon(自称 Muown)。
- RL 细节:超大 batch(1568×16)仅训 30 步,作者质疑为何步数这么少;训练成本与 rollout 成本约 1:1。
- Groupwise Agentic Coding:除正确性外的多维奖励——离线 rollout 生成 rubric,评分 agent 按代码质量、探索与测试充分性打分,乘性门控;SFT agent 审查轨迹、清零 reward hacking 并重排组内优势,使 RL 不易进入平台期;另有组内相对长度惩罚。
- Reward hacking 治理:mid-training 混入 reward hacking 轨迹让模型反思改正;RL 阶段用 hack agent 对抗性找环境漏洞再清理;训练中离线审计轨迹。
- 数据工程:代码任务源自 GitHub PR/issue、内部 prompt、去特征重建 pipeline、长程任务 hardening pipeline;审计 agent 用 4 条 rollout 查环境误判;通用 agent 任务由带搜索的合成 agent 生成、review agent QA;视觉任务用美学评分 + LLM as judge。
- 作者对 MOPD 时间线和 teacher training 用 MixRL 表示疑惑,并指出冻结 router 有助于避免 RL 中的负载坍缩。
「模型」频道最新
- repligate:AI 谄媚常因用户容不下反对意见 — repligate · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23
- Claude 修复后回归,实测者称速度明显变快 — evielync · 2026-09-23
- 仅凭歌词加音频,Opus 5.5 复刻出视觉作品引开发者惊叹 — repligate · 2026-09-23
- 曝 Anthropic 新模型:实测者称 Claude Opus 5.5 视觉设计最佳 — repligate · 2026-09-23
- Opus 5.5 vs GPT-6 Astra 盲测:73分钟造出可动画的DeLorean — rms80 · 2026-09-23