40 个长程编码任务测试烧掉 5 万美元,学界恐被 eval 成本挤出

himanshustwts · x · 2026-10-03

作者 anandnk24 称团队一天内在 40 个长时程(long horizon)编码任务上做基准测试就花了 5 万美元,并预测大学将因经费问题被挤出 AI evals 领域。

核心逻辑:随着 agent 任务设计得越来越难,轨迹(trajectories)变得更长、消耗的 token 数量大幅上升,意味着推理与算力开销显著增长。靠大学科研经费运作的学术团队很难承担这种规模的 eval 成本,AI 评测工作可能逐渐向资金雄厚的大厂集中。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →