Wally 推理栈发布:GLM-5.3 Max 达 790 tok/s 主打开源模型高速推理
ycombinator · x · 2026-09-22
RunAnywhereAI 发布 Wally,一个面向开源前沿模型的推理栈,主打"最快的运行地"。性能快照:GLM-5.3 Flash 380 tok/s、GLM-5.3 Max 790 tok/s、Qwen3.8-27B 485 tok/s、DeepSeek-V4.1 Flash 615 tok/s。
「Infra」频道最新
- 树莓派固件锁定原始内存容量,禁止用户换更大 RAM — ngxson · 2026-09-22
- fal 推出 H3 Max:3 秒生成 5 秒前沿级视频,全栈优化揭秘 — gorkem · 2026-09-22
- NVIDIA EPD 分离架构:图像首 Token 最快提速 5 倍 — dl_weekly · 2026-09-22
- 16GB Mac 本地跑 MiniMax H3 生视频:8-10 秒片段约 15-20 分钟 — coberholzer · 2026-09-22
- 30步×每步2.5万rollout的异步RL训练配置曝光 — willcb · 2026-09-22
- Lisa Su 执掌 AMD 十一年:市值从 20 亿涨到 1 万亿美元 — xiaosun86 · 2026-09-22