40 个长程编码任务测试烧掉 5 万美元,学界恐被 eval 成本挤出
himanshustwts · x · 2026-10-03
作者 anandnk24 称团队一天内在 40 个长时程(long horizon)编码任务上做基准测试就花了 5 万美元,并预测大学将因经费问题被挤出 AI evals 领域。
核心逻辑:随着 agent 任务设计得越来越难,轨迹(trajectories)变得更长、消耗的 token 数量大幅上升,意味着推理与算力开销显著增长。靠大学科研经费运作的学术团队很难承担这种规模的 eval 成本,AI 评测工作可能逐渐向资金雄厚的大厂集中。
「编程与Agent」频道最新
- 开发者用 Claude 一晚搭出视频生成流水线,产出两款产品营销视频 — cneuralnetwork · 2026-10-03
- toolcall-check:检测 chat API 嵌套工具调用与流式重建的小型 CLI — Arthur122103 · 2026-10-03
- 开发者分享:用多个小 Agent 端到端跑通营销投放全流程 — Few_Benefit_4853 · 2026-10-03
- GPT 写的是「屎山代码」?RL 奖励错配或毁掉工程质量 — xiaohu · 2026-10-03
- 用确定性状态插件解决本地模型长任务中的目标漂移 — paulqq · 2026-10-03
- Reddit 开发者用 Hermes 定时任务自动处理 Sentry 生产报错,痛点不少 — pauljasperdev · 2026-10-03