美团开源 CAST:用游戏求解器教 LLM 玩长线决策游戏
meituan-longcat · hf · 2026-07-30
美团开源了 CAST(Credit Assignment from Solver Teachers)框架,旨在解决大语言模型(LLM)在长周期决策任务中强化学习(RLVR)奖励稀疏的问题。
- 核心思路:通过追踪游戏求解器状态价值的变化,判断特定动作是否推进成功,并将其转化为逐步的奖励信号注入 RLVR 中。这相当于在仅需要标量值的情况下实现了软最优求解器的在线策略蒸馏。
- 评测表现:在推箱子、扫雷和 Rush Hour 等游戏中,CAST 在域内和未见过的难度测试下均超越了所有基线模型。此外,在 ALFWorld 和 WebShop 上也取得了最高的平均零样本性能。
- 开源地址:代码已在 GitHub 发布。
「编程与Agent」频道最新
- 开发者新梗:不是 Slop Cannon 就是 Slop Mop — braelyn_ai · 2026-07-30
- Agent 改变 LLM 负载:输入输出 Token 比例高达 300:1 — appenz · 2026-07-30
- UCSB与LinkedIn新研究:让Agent自己预测工具调用 — dair_ai · 2026-07-30
- evalstats:抗LLM裁判偏差的统计测试工具开源 — IanArawjo · 2026-07-30
- OpenAI Responses API 即将支持自动压缩,重塑长上下文开发范式 — GregKamradt · 2026-07-30
- 开发者构想多智能体结对编程:Sol 与 Fable 协作解题 — shakoistsLog · 2026-07-30