复现前沿 benchmark 发现数据缺陷:ALE Linux 子集移植出 ALE-Gold
dejavucoder · x · 2026-09-18
作者在 Prime Residency 期间将 UC Berkeley Dawn Song 团队的前沿 benchmark Agents' Last Exam(ALE)的 Linux CLI 子集移植到 Verifiers v1,过程中深入检查数据后发现了诸多问题,最终产出了修正版 ALE-Gold。
- 移植挑战:rollout 耗时优化、依赖规格缺失、Verifiers v1 初版缺陷(现已修复)
- 数据问题:任务契约欠约束、evaluator 缺陷、答案泄漏与网络问题、输入损坏与依赖缺失、参考数据缺失或损坏
- 发布了 Sol (xhigh) 与 Luna (xhigh) 的完整评测对比、逐任务对比、失败模式分析与分领域表现
- 结论:工程实现仍有很大改进空间
所属事件:研究者复现前沿评测 ALE 发现数据缺陷并发布修正子集(3 条相关)→
「研究」频道最新
- NVIDIA 开源教程:记忆驱动自模型 Agent 准确率 90.9% 超 RAG 基线 — dl_weekly · 2026-09-18
- 新论文:三指标路由器让 16GB 消费级 GPU 长上下文 RAG 零 OOM — chaumian · 2026-09-18
- AI 数据实验室主张:通用合成数据比模型架构更关键 — Paimaamu · 2026-09-18
- 3DV 2027 设 Nectar Track:2 月 15 日截止征稿 — ftm_guney · 2026-09-18
- 开发者做工具拆解 Anthropic Mythos 对话记录,可按标记行为跳转 — round · 2026-09-18
- 研究尝试:48 头注意力校准压缩到 12 头,其余换带状稀疏注意力 — ostrisai · 2026-09-18