IRL 评测法适用场景:多任务多运行

xeophon · x · 2026-08-28

作者补充说明,该 IRL 评测方法需要符合论文描述的数据形状:评测任务需达数百个,且每个任务需要多次运行(建议 8-32 次)。该方法适合用于计算 avg@8 或 avg@16,以此节省成本。

所属事件:实测基于 IRL 的评测采样法可省 20-70% 算力(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →