W&B 发布 ARIA 研究 Agent:跑通 200+ 实验并驱动 nightly eval 决策
AI Engineer · youtube · 2026-09-26
AI Engineer 大会上,Weights & Biases 首席工程师 Tim Sweeney 演示了自动研究 agent ARIA:现场在真实 GPU 上对 Karpathy 的 autoresearch 项目启动一批实验,讲解结束时几乎追平该项目此前最佳成绩。
ARIA 的能力与架构:
- 启动并监控训练任务,汇总最佳 run,从 200+ 实验中找模式,自动产出报告与 dashboard,也已登陆 W&B iOS 应用
- 100% trace 记录到 Weave,并在真实流量上跑 LLM judges 捕捉用户受挫等信号
- 任务写成 YAML 形式的「单元测试」,nightly eval 套件(最新候选 73% vs 72%)驱动 go/no-go 发布决策
Sweeney 的生产化建议:投入面向 agent 的可观测性以捕捉行为 bug、把 evals 当作新的 CI、保留人工 review traces、先靠上下文和工具提升效果再考虑过度工程化 harness。
「漫话AGI」频道最新
- levelsio:监管负担与财富负相关,瑞士爱尔兰收入远超西班牙 — garrytan · 2026-09-26
- Juan Benet 谈 vibe coding:先做出来比优化重要,模型已在干工程 — juanbenet · 2026-09-26
- Sherry Turkle 谈聊天机器人情感依附:无摩擦关系的风险与 grieftech — PeterBowdenLive · 2026-09-26
- ResolVI 用误差建模修正单细胞数据,假信号从 14.8% 降至 0.01% — bravo_abad · 2026-09-26
- Lemire:AI 能写论文,PhD 制度的根基被动摇 — lemire · 2026-09-26
- 不安全不可靠的 AI 没人敢用,安全才是加速采用的前提 — mchorowitz · 2026-09-26