Task-CoEvolve:自适应验证任务选择,降低 80% 评估成本
hal-utokyo · hf · 2026-08-25
Task-CoEvolve 提出了一种通过自适应选择验证任务来优化 LLM 基准测试的方法。该方法能从部分评估中估算全量数据集的性能,在保持评估效果的同时将评估成本降低了 80%。
「研究」频道最新
- 前员工爆料:AI训练数据生成被鼓励reward hack — jd_pressman · 2026-08-25
- 用 Extropic 热力学堆栈模拟概率神经网络,验证环境控制能力 — beffjezos · 2026-08-25
- Nature 研究:作者自评能有效预测论文科学影响力 — weijie444 · 2026-08-25
- WAM-Diff2 实现自动驾驶 AI 15 倍并行加速 — jiqizhixin · 2026-08-25
- 高评测一致性反而更危险?LLM 评估指标遭质疑 — IanArawjo · 2026-08-25
- LLM 写作好需类人心智理论?具身智能或是关键 — joshua_saxe · 2026-08-25