移植前沿基准 Agents' Last Exam 后,作者发现大量数据缺陷
dejavucoder · x · 2026-10-11
作者在 Prime Residency 中把 UC Berkeley Dawn Song 团队打造的 Agents' Last Exam(ALE)Linux CLI 子集移植到 Verifiers v1,过程中深入检查基准数据,发现问题不少:
- 任务契约不明确:多个任务描述含糊,评估器本身有缺陷
- 答案泄漏与网络问题:部分任务存在答案泄漏,以及推理时的网络依赖
- 坏输入与缺失依赖:输入损坏、依赖未声明,导致任务无法正常执行
- 参考数据缺失或损坏
基于这些问题,作者构建了清洗后的 ALE-Gold 数据集,并给出 Sol (xhigh) 与 Luna (xhigh) 等模型的对比评测、失败模式与分领域表现分析。结论:这个由 300+ 专家参与的前沿基准,工程质量仍有很大改进空间。全文是完整的移植与数据审计工作日志。
「研究」频道最新
- 从 Scaling Laws 到 Downscaling Laws:剪枝 43% 保留 70% 性能且零重训 — Tanmoy_Chak · 2026-10-11
- rewrites.bio 宣言:AI 重写生物信息学工具需提速更需验证 — jmschreiber91 · 2026-10-11
- Nature 子刊论文:新闻室 AI 情感优化亟需行为学评估 — lulzxdxdxd · 2026-10-11
- tangermeme 优化 extract_loci,基因组建模数据加载提速十倍达 0.35 秒 — jmschreiber91 · 2026-10-11
- auto-optimize 再下战果:基因分析工具 fimo 提速约 20 倍且结果完全一致 — jmschreiber91 · 2026-10-11
- 13行证明Catalan常数无理性,OpenAI形式化证明争议实为社区惯例误解 — ctjlewis · 2026-10-11