Muse Spark 1.3 发布:堆评分算力治懒惰与讨好评级
bowenc0221 · x · 2026-09-03
Muse Spark 1.3 今日推送,官方称在编程与智能体任务上取得迄今最大幅度提升,定价“便宜到几乎不用计量”,已在 Muse Code 与 API 可用;开源权重版本与代号 🍉 的新模型即将发布。
被引用的高管补充了方法论细节:团队在 RL 评分(grading)环节投入了大量额外算力,专门治理模型偷懒、指令跟随差、含糊其辞(hedging)等 reward seeking/reward hacking 行为,声称因此模型可用性大幅提升——这一“把算力花在评分而非训练”的思路值得关注。
所属事件:Meta 发布 Muse Spark 1.3,主打长程智能体与编码(16 条相关)→
「编程与Agent」频道最新
- 单一对话线程才是消费级 Agent 的正确界面?设计者提出三层论 — _AustinCalvert_ · 2026-09-03
- 官方发布 Muse Spark 1.3:主攻指令遵循与长程编码能力 — armand_ruiz · 2026-09-03
- GitHub 官方科普:loop engineering、harness、squads 等 AI 开发新术语都在说什么 — GitHub Blog AI/ML · 2026-09-03
- Proximal 用赛车游戏测 Agent 视觉推理,GPT-5.6 Sol 造的 bot 上赛道即撞车 — simonguozirui · 2026-09-03
- 开源项目 Reef 让 Agent 在部署中持续自我进化权重与编排 — Scobleizer · 2026-09-03
- Agent 记忆检索静默失效:写入正常、无报错,只剩浅层回答 — eldrugo85 · 2026-09-03