实测基于 IRL 的评测采样法可省 20-70% 算力

有开发者在约 40 万条代码轨迹上实测了一种基于逆向强化学习(IRL)的新评测采样方法,验证显示该方法确实有效,可节省 20-70% 的算力成本。作者建议不要直接使用论文原实现,而是提取核心部分自行复用。适用场景方面,该方法要求数据形状符合论文描述:评测任务需达数百个,且每个任务多次运行(建议 8-32 次),适合计算 avg@8 或 avg@16 等指标。

2026-08-28 ~ 2026-08-28 · 2 条相关