新研究探索推理时激活空间上的策略梯度推理
burny_tech · x · 2026-08-28
该帖子分享了一篇题为《Seek in the Dark》的论文,提出了一种在潜在空间的激活上而非权重上进行强化学习的方法。这种推理时实例级策略梯度为推理过程提供了新的优化视角。
所属事件:LatentSeek 在潜在空间强化推理超越思维链(2 条相关)→
「研究」频道最新
- 实测 7400 条轨迹:Terminus 2 最精简,CC/Codex 上下文膨胀三倍 — zainhas · 2026-08-28
- 谷歌 PPE 引擎综述:多领域预测精度显著超越专家管线 — ymatias · 2026-08-28
- Google Earth AI 推出行星预测引擎:自然语言生成地理洞察 — ymatias · 2026-08-28
- METR 发布 Hugging Face 攻击报告,被誉后人类文明首份人类学 — anderssandberg · 2026-08-28
- 视觉论文陷入“Instagram 时刻”:重结果轻科学,复现困难 — taiyasaki · 2026-08-28
- Judea Pearl:基因与 IQ 之争可循吸烟致癌路径科学求解 — yudapearl · 2026-08-28