一种新指标用预算拐点比较人类与智能体能力
littmath · x · 2026-07-22
提出了一种衡量 AI 智能体能力的新方法:expenditure horizon(支出拐点)。
- 方法把人类和智能体在连续评分、开放式优化任务上的表现,放到同一条“预算—收益”曲线上比较。
- 观察随着预算增加,谁的单位花费带来更多改进;当人类重新变得更划算的那个预算点,就是智能体的 expenditure horizon。
- 这个指标试图用“花多少钱能跑多远”来刻画 agent 能力,而不只是看固定预算下的单点成绩。
所属事件:METR 提出“支出天际线”评估智能体能力(2 条相关)→
「研究」频道最新
- ARC AGI 3 应该保持私有,不该公开示例和数据集 — flowersslop · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- 一个问题追问多智能体分支如何随算力和模型规模变化 — iskander · 2026-07-27
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27