SCOPE:让 LLM 在开放任务上自我提升

PMinervini · x · 2026-07-03

转述 Cyrus Kwan 的研究:SCOPE 方法通过协同演化的自博弈(self-play)与基于评分标准(rubric)的评估,让大语言模型在无需精选数据的开放任务上实现自我提升。

该工作为 LLM 自我改进(self-improvement)提供了新的可行路径。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →