单卡 RTX 5090 跑 274 tps,实测 Meta 新模型 Muse Glimmer
Scobleizer · x · 2026-08-11
开发者分享了上手 Meta Muse Glimmer 稠密模型的初步体验:
- 推理速度极快:在单张 RTX 5090 显卡上,使用 DFLASH 配置平均可达 208 tps,最高 274 tps。
- 编程能力对比:在生成 HTML5 鲨鱼生存小游戏时,效果不如 Qwopus Coder,前端视觉审美(HTML canvas taste)略显欠缺,但后端逻辑稳定,可通过 SFT 微调改善。
- 思考模式体验:开启高强度思考模式后运行耗时依然很短,不像目前的本地王者 Qwen 27B 3.6 那样容易“过度思考”(overthink)。
作者认为,对于常规的本地编程任务(App、游戏、网站和视觉工具),该模型已具备极高的实用潜力。
所属事件:单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测(8 条相关)→
「编程与Agent」频道最新
- 开发者实测分享:完全不读 AI 生成的代码,仅靠系统级设计构建应用 — tawnniee · 2026-08-11
- Browser Use CLI 3.0 集成至 Hermes,Token 消耗大降 60% — Teknium · 2026-08-11
- Hermes Agent 发布浏览器自动化工具集,支持多后端与反检测 — NousResearch · 2026-08-11
- 用户让 Open Claw 智能体彻夜运行,成功抢到健身预约 — gregmushen · 2026-08-11
- Weights & Biases 推出 agent 会话追踪工具,按执行逻辑导航 — wandb · 2026-08-11
- 纯 Rust 运行 YOLO 模型:支持 ONNX Runtime 推理 — tom_doerr · 2026-08-11