实验显示该方法在成熟策略场景里反而有害
YouJiacheng · x · 2026-08-04
被引用的实验结论很明确:在一个成熟的 action-policy 场景里,这个方法不仅没有帮助,反而让效果更差。
作者还补充说,他们尝试过多轮超参数搜索来把它调通,但最终还是没有找到有效解法。
「研究」频道最新
- Lanyon 基准称前沿模型解 Euler 方程频繁失手 — CatAstro_Piyush · 2026-08-04
- 2016 点云重建论文用 Min-of-N 损失建模形状歧义 — YouJiacheng · 2026-08-04
- 一篇 2016 年 3D 重建论文重回 top-K 损失讨论 — YouJiacheng · 2026-08-04
- 阿里 UEmbed 把多模态稀疏和稠密检索统一到一模型 — Alibaba-NLP · 2026-08-04
- WorldExam 评测视频模型能否生成真正会反应的世界 — Yuxue Yang · 2026-08-04
- SKT 用验证过的合成轨迹训练智能体更好用技能 — Shanghai-AI-Laboratory · 2026-08-04