新型推理努力控制方案曝光:分级 GRPO 训练引热议
stochasticchasm · x · 2026-09-11
博主 stochasticchasm 分析了一种新颖的 reasoning effort 控制方案,认为其与 OpenAI 的 juice 值思路相似,可实现更细粒度的控制:
- 训练设置有趣之处在于 GRPO 的用法:每个组在单一 effort 水平上采样,而每个任务在多个 effort 水平上采样
- 参考长度 "Lnorm" 与 k3 按问题校准的参考长度类似
- 作者猜测该方案可显著提升吞吐量,并指出 v4 中对 batch invariance 的关注可能与此相关
整体是对前沿实验室推理算力调控机制的技术解读长帖。
所属事件:DeepSeek V4.1 技术报告解读:KV 压缩与推理努力参数引热议(9 条相关)→
「模型」频道最新
- OpenAI 内部模型被称已证明 Navier-Stokes 千禧年难题 — QuintinPope5 · 2026-09-11
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11