Tropical RL:指出现有 LLM 强化学习代数结构不适配组合任务
burny_tech · x · 2026-10-07
研究团队提出 Tropical Reinforcement Learning,并指出现有标准 RL 难以让 LLM 有效学习组合性任务的根本原因:其代数结构不是最优的。传统做法把所有成功答案的概率求和,只能衡量模型「多常成功」,无法刻画「哪条解法成功了」,而 Tropical 代数(max-plus)用最大值取代求和,可更好追踪最优解路径。属于对 RLVR 训练方法的底层反思与新框架提案。
「研究」频道最新
- eigenrobot:数学论文自动化很直接,理论物理甚至经济学也可大规模自动化 — eigenrobot · 2026-10-07
- Fleuret:数学的真理「与上下文无关」,这是其他领域都不具备的特质 — francoisfleuret · 2026-10-07
- 推理模型问世仅两年,AI 已贡献相当于 20 枚菲尔兹奖的数学成果 — __nmca__ · 2026-10-07
- 新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点 — NationalUniversityofSingapore · 2026-10-07
- MEND:近端速度匹配强化学习,100 步训练超越 Flow-GRPO 约 4000 步 — UTEXAS · 2026-10-07
- JLD 感知距离:从冻结视觉编码器雅可比矩阵导出,100 张图 35 秒拟合即超 LPIPS — Shreshth Saini · 2026-10-07