Tropical RL:指出现有 LLM 强化学习代数结构不适配组合任务

burny_tech · x · 2026-10-07

研究团队提出 Tropical Reinforcement Learning,并指出现有标准 RL 难以让 LLM 有效学习组合性任务的根本原因:其代数结构不是最优的。传统做法把所有成功答案的概率求和,只能衡量模型「多常成功」,无法刻画「哪条解法成功了」,而 Tropical 代数(max-plus)用最大值取代求和,可更好追踪最优解路径。属于对 RLVR 训练方法的底层反思与新框架提案。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →