Agents' Last Exam:前沿 AI 智能体评测基准
ajratner · x · 2026-07-12
Agents' Last Exam (ALE) 是一个旨在评估前沿 AI 智能体在现实世界、长周期任务中表现的新基准。
- 基准特点:包含 1500+ 个由专家提出的任务,覆盖 55 种非物理职业,由来自 100 多个机构的 300 多名专家贡献。
- 评估方式:所有任务均基于真实的专家工作,并采用完全可验证、基于结果的评分标准进行评估。
- 行业应用:该基准正成为前沿智能体开发的重要参考,OpenAI 的新模型(推文提及 GPT-5.6)在该基准上取得了强劲表现。
所属事件:ICML 2026 聚焦智能体评测与隐私安全(4 条相关)→
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11