Meta 用 100+ agent 行为评估表打磨 Muse 七个月
Hesamation · x · 2026-10-12
据 Meta 首席 AI 官 Alexander Wang 透露(经 Hesamation 转述),Meta 自 2 月起研发 Muse 智能体,原型仅用 1-2 周完成,但随后花了 7 个月打磨可靠性:
- 团队在电子表格中追踪了 100+ 项具体的 agent 行为
- 每项行为都有独立 eval,并设置阻断上线(launch-blocking)的阈值
- 直到 Muse Spark 1.3 版本,全部 100 项评估才全部通过
- 模型+产品团队总共不到 200 人
作者指出,这解释了 7 个月的发布间隔:此前的 OpenClaw 虽有惊艳时刻但经常出故障,多数用户因此流失。Meta 从中吸取的教训是「可靠性本身就是产品」——至于能否经受住数百万用户的检验,仍是未知数。
「编程与Agent」频道最新
- 开源 Buddy 2.1:让 Claude Code 直接操控你的安卓手机 — 3amae404 · 2026-10-12
- 让 Grok 智能体给自己写应用,开发者做出可对话的 Vision Pro 机器人 — Baconbrix · 2026-10-12
- Agent 治理悖论:没人说 NO,谁授权了 YES? — Portotify · 2026-10-12
- 3 台 DGX Spark 搭本地 AI RPG:GLM 模型加 ComfyUI 全离线跑通 — HankYeomans · 2026-10-12
- Qwen Code 发布 v0.25.1 nightly,集中修复 managed-agent 稳定性 — qwen-code-review-bot · 2026-10-12
- Google 试点新面试轮:可开着 Gemini 读代码找 bug,告别纯刷题 — dotey · 2026-10-12