SPADE 框架:自博弈设计可执行环境提升推理能力
Bo Liu · hf · 2026-08-20
SPADE 是一种自博弈强化学习框架,语言模型在其中设计自适应的可执行训练环境并尝试解决。通过基于悔恨的环境定位,该框架有效提升了模型的推理和工具使用性能。
「研究」频道最新
- 3DGS-Uncertainty:高斯泼溅的新视图预测不确定性 — rsasaki0109 · 2026-08-20
- SemComp-Bench:视频生成语义任务完成度基准发布 — FrameXAI · 2026-08-20
- Zetta ζ:闭环具身框架让机器人在线自进化技能 — Xin Ding · 2026-08-20
- SoftVTBench:面向可变形操作的视触数据集 — TuojingAI · 2026-08-20
- 潜在世界模型中的决策度量对齐研究 — simple-world-lab · 2026-08-20
- 机器人操作比纯视觉难题更具可控性 — chris_j_paxton · 2026-08-20