实验显示该方法在成熟策略场景里反而有害

YouJiacheng · x · 2026-08-04

被引用的实验结论很明确:在一个成熟的 action-policy 场景里,这个方法不仅没有帮助,反而让效果更差。

作者还补充说,他们尝试过多轮超参数搜索来把它调通,但最终还是没有找到有效解法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →