32GB M4 MacBook Air 上跑出 8-22 tok/s,Cherenkov 引擎刷新 Qwen3.8 极限
alfredr · reddit · 2026-09-11
- 开发者发布开源推理引擎 Cherenkov,专为 Apple Silicon 设计,在仅 21GB 内存分配下让 Qwen3.8-Flash-Next(Q4 混合精度)跑出 8-22 tok/s,自称刷新了该模型在内存受限设备上的推理纪录。
- 核心思路是不把整个模型载入统一内存,而是维护一个有界的专家工作集,并用单层前瞻预测下一步需要的专家,同时提前发起 SSD 读取,可选混合精度执行。
「Infra」频道最新
- 五角大楼拟向 AI 云初创 Fluidstack 提供约 50 亿美元贷款 — vitaliychiley · 2026-09-11
- 观察:v4 训练无失稳,1M 上下文撑约 10T token 训练量 — stochasticchasm · 2026-09-11
- Eric Schmidt:AI 的真正瓶颈不是电力而是钱,万亿美元资本难筹 — rohanpaul_ai · 2026-09-11
- SpaceX 再签 AI 算力大单:月入 11.1 亿美元,年化 ARR 冲 1000 亿 — NinaDSchick · 2026-09-11
- Carmack:Jetson Thor 128GB 内存对实时机器人是过度配置 — ID_AA_Carmack · 2026-09-11
- YC Demo Day 钻石晶圆初创揽 1.6 亿美元意向订单,挑战硅基芯片 — ycombinator · 2026-09-11