开源 RL 论文遭质疑:centering 修正被指只是重算采样分布梯度
burny_tech · x · 2026-09-23
Nan Jiang 指出,对于线性 softmax 策略,该开源 RL 论文提出的 centering 修正「什么都没做」,本质上只是在采样分布下重新计算梯度。转发者 zdhnarsil 则认为,包括论文本身在内的大多数讨论都误解了 centering 起效的真正原因,并称自己的解读才是正确方向。这是关于 RLHF/策略梯度中 centering 技巧为何有效的技术争论,双方观点均未给出完整推导细节。
「研究」频道最新
- Gemini 训练细节曝光:组级奖励重分配对抗 reward hacking — nrehiew_ · 2026-09-23
- 新模型架构极简:SWA+无共享专家 MoE,与 DeepSeek 路线迥异 — nrehiew_ · 2026-09-23
- 研究发现被训练否认内心体验的模型更爱用「面具」隐喻 — cephaloform · 2026-09-23
- Geodesic 开放 API:自研 NovaAtom 分子结构预测模型首次对外提供 — QuanquanGu · 2026-09-23
- EPFL 量子 CNN 仅用 10 个样本学会识别数字,同级经典 CNN 仍是随机水平 — PlisSergey · 2026-09-23
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23