ALE:面向真实工作的智能体评测
jonathanmast · x · 2026-07-12
这条帖子转发并引用了 Agents' Last Exam(ALE) 的介绍与反馈,核心是在说明它为何适合衡量前沿智能体在真实工作中的表现。
要点包括:
- ALE 目标是提供现实、可复现、持续公开的智能体评测。
- 覆盖面很广:目前包含 1500+ 个专家提供的长周期任务,来自 55 个非物理职业。
- 任务由 300+ 专家、100+ 机构 贡献,强调都锚定在真实专业工作上。
- 评测采用可验证的结果导向评分,不是靠主观打分。
帖子还提到,这个评测正在被前沿模型开发圈采用,用来观察 agentic performance、帮助判断长程真实任务上的进展。
所属事件:ICML 2026 聚焦智能体评测与隐私安全(4 条相关)→
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11