Scale CEO 力推助手评测:Muse 综合得分 9.3,4–1 胜 Instinct
alexandr_wang · x · 2026-09-09
Scale CEO Alexandr Wang 转发 assistantbenchmark.com 上 Muse 与 Instinct 两款 AI 助手的正面对比:Muse 以 4–1(1 项平局)胜出,综合分 9.3 对 8.6。评测用 16 项同规模真实任务打分,重点差异包括:
- 执行在线任务:Muse 8 分,遇到周末芝加哥酒店紧张时主动返回 4 个可退款方案并给出改预算/换日期选项。
- 差旅预订:Instinct 得 10 分,能登录用户自己的账号订机票酒店、自动值机并处理登机牌;Muse 只走 Duffel 聚合渠道,供给受限,只能让用户改约束条件。
- 消费与推荐:Muse 在按预算下单鲜花、预约餐厅等场景表现细腻,会先列明细请求批准,并用虚拟卡隐藏真实卡号。
该帖本质是 Scale 一方对自己评测体系(及 Muse)的宣传,但评测维度与逐项案例细节较为具体,可作 agent 能力横评参考。
「模型」频道最新
- Astra 在仪表盘上出怪错:仅用 44% 上下文就翻车 — eigenron · 2026-09-09
- NVIDIA 开源 IMO 金牌系统 Nemotron:含模型、数据集与 200 道新题 — kuchaev · 2026-09-09
- Claude Code 重度用户被要求提交政府证件做网络安全验证 — Bulky-Priority6824 · 2026-09-09
- 从 o1-preview 到数学超人类只用了两年,RL 突破人类级评测 — jam3scampbell · 2026-09-09
- Meta AI 助手 5 项任务实测全面胜过 Instinct 与 ChatGPT Work — garrytan · 2026-09-09
- 三台未标定相机一提示搞定机械臂标定,误差小于0.2毫米 — burny_tech · 2026-09-09