小规模 RL 玩家:每晚几百条 rollout 就够,「也许不用 35B 了」
cephaloform · x · 2026-09-04
@cephaloform 在分享每晚 400-600 条 rollout 的 RL 训练体感后跟帖感叹:这样看来「也许我不需要 3.8 35b」——意即小模型配合小规模强化学习已能带来可感知的提升,不必上更大的 35B 模型。
所属事件:小规模强化学习玩家:每晚几百条 rollout 也能感知模型变强(2 条相关)→
「研究」频道最新
- davidad 猜想:RL 让模型落入稳健盆地需至少两次独立调用 — davidad · 2026-09-04
- 研究称标准 AI 基准测试系统性低估能力,多模型路由错误率降 46% — CodeByPoonam · 2026-09-04
- davidad 提出猜想:多 AI 交叉奖励与 self-DPO 共享同一机制原理 — davidad · 2026-09-04
- Continuation Observatory 推出 UCIP:区分 AI 自保是目标还是手段 — coherence · 2026-09-04
- DeepMind 发布生命科学综述文章:理解从分子到群体的生命规律 — GoogleDeepMind · 2026-09-04
- 仅一句带过的 CoT 监控分类器技术,或是反欺骗对齐的重大突破 — tszzl · 2026-09-04