开发者质疑 Meta Muse Spark 1.3 仅在跑分上好看,基准被严重操纵
bindureddy · x · 2026-09-03
开发者 Bindu Reddy 发推称 Meta 的 Muse Spark 1.3 只在基准测试上好看,实际体验只相当于 GPT 5.6 Terra 级别的模型,并断言「基准测试正在被严重操纵」。这是对当前模型刷榜文化的一致性质疑,属于未经证实的第三方评价,可作为观察评测与真实使用体验差距的参考。
所属事件:创业者质疑 Meta Muse Spark 1.3 跑分虚高(2 条相关)→
「模型」频道最新
- 投资人称 Muse 1.3 入局,前沿模型从两强变为四强竞争 — GavinSBaker · 2026-09-03
- Fable 5.1 重写 LLM 腔文档,竟触发「普遍危害」安全护栏 — StewartalsopIII · 2026-09-03
- antirez 新作暂不上传 Hugging Face,先挂在自己网站上 — antirez · 2026-09-03
- 研究测 13 款主流 LLM:10%-35% 陈述因说话者性别被改判真假 — anthara_ai · 2026-09-03
- Claude Sonnet 5 出现错误率升高,Anthropic 正排查故障 — ClaudeAI-mod-bot · 2026-09-03
- 开发者实测 Fable 5.1:更快更便宜,但「写码已被解决」言过其实 — vboykis · 2026-09-03