Meta Muse 实测:任务一多就失忆,个人化智能体尚不成立
deliprao · x · 2026-09-19
Delip Rao 发布对 Meta 的 Muse agent 的控制变量实测,结论是「Muse 能扩展到数百万用户,却无法个人化扩展」:
- 通过逐步增加复杂度的对照实验发现,需要管理的 cron 任务越多,失误越多,最终会丢失早期的重要指令;
- 除模型与 harness 的常见缺陷外,他怀疑存在用户不可见的静默失败,如用户规模扩大后 cron 任务失败率上升;
- 模型与上下文管理也有明显短板:Muse 经常索要已在上下文或更长历史中的信息(分别指向模型与 harness 问题)。
他的判断:Muse 的 UX 设计出色,能满足多数用户的部分需求,但本质上仍是反应式 agent,需要用户主动推动,无法成为高度个人化的 ambient intelligence 伴侣——也许这本来就不是 Meta 的目标。他由此引申:出于主权之外的考量,拥有并管理自己的「智能基础设施」(dedicated compute)很重要。作者注明这是 n=1 观察,但认为对 AI 产品而言 vibe eval 有意义。
「编程与Agent」频道最新
- Anthropic 宣布 Claude Code 终于支持 AGENTS.md 标准 — iannuttall · 2026-09-19
- 别手写 agent 的「汇编」:编译器式框架才是正途 — lateinteraction · 2026-09-19
- 用 Jev+OCR 做图像分类器,40 秒归类约 900 张图 — gaganghotra_ · 2026-09-19
- Blender 场景生成太稀疏?用 GPT Image 迭代参考图 14 版变精 — kevinkern · 2026-09-19
- ambient agents 成真:开发者称已可落地实现 — kieranklaassen · 2026-09-19
- Trylle 推出 Magic Sessions:从 issue 到 PR 的云端长任务编码 — ayushtweetshere · 2026-09-19