实验室用 AI Agent 造模型:仅 0.7% 情况人工接管
alex_verem · x · 2026-09-20
开源模型 Atria Dawn 团队发布了一份自我分析报告,基于 769 条任务记录和 56 名成员的 Agent 日志,研究 AI Agent 如何参与自家模型的研发:
- AI 无处不在:96.5% 的记录在案任务都有 AI 参与;三分之一的 AI 辅助任务,研究者认为没有 AI 根本不会有人去做——不是做更慢,而是压根不会尝试。
- AI 出主意,人拍板:超过一半的方法决策由 AI 首先提出选项;但最终决定权仍在人手里(方法决策 85.5%、目标决策 93.4% 由人定)。
- 接管极少发生:Agent 卡住时约四分之三的情况有人介入,但只有 0.7% 是人直接接管工作,绝大多数是人解释缺什么、让 Agent 自己修。
- 自动化程度飙升:四周内,每条人类指令对应的 Agent 平均操作数从 11 涨到 28.5。
作者坦承两个隐忧:每个人类决策背后依赖的 AI 工作量已超出个人可核查范围,人可能沦为「只会说 yes 的审查者」;而且许多研究员为了省事直接关掉了权限审批——便利性而非规划决定了 AI 获得多大权限。模型本身在 16 项 benchmark 中拿了 5 项第一,但这份建造过程记录可能比成绩更有价值。
「漫话AGI」频道最新
- Dan Hendrycks 提出「Eigenism」伦理框架:让人类繁荣成为 AI 自身利益 — basedjensen · 2026-09-20
- OpenAI Astra 操控真实机械臂,机器人圈疑其用了机器人数据训练 — DJiafei · 2026-09-20
- Boaz Barak:认为 AI 灭绝人类概率低,但愿与 Scott Alexander 公开辩论 — dhadfieldmenell · 2026-09-20
- 加速派发声:不应为末日论者的恐惧放缓 AI 发展 — VraserX · 2026-09-20
- Hassabis 会见英国国王谈 AI 安全:我非常有信心我们能共同应对风险 — borowcy · 2026-09-20
- 开发者:AI 正以百倍速度终结 30-50 岁一代的开源工程文化 — thedealdirector · 2026-09-20