flashtensors:单 GPU 秒级热切换数百大模型,冷启动低于2秒
tom_doerr · x · 2026-08-03
GitHub 项目 flashtensors 是一个推理引擎,通过将模型从 SSD 加载到 GPU 显存,速度比传统加载器快 10 倍,可在单 GPU 上运行数百个大模型,热切换时间小于 2 秒。该项目基于 ServerlessLLM 构建,采用 Apache 2.0 许可。
「Infra」频道最新
- 4080 显存吃紧?开发者尝试本地运行 MiniMax 视频模型遇阻 — witcherknight · 2026-08-03
- 异构硬件逆袭:Lucebox 本地跑 DeepSeek 速度超 DGX Spark 3.6 倍 — samsja19 · 2026-08-03
- 单GPU服务10+机器人:开源VLA部署新架构 — danfei_xu · 2026-08-03
- 从3D游戏到AI算力霸主:英伟达GPU发家史回顾 — TinfoilTricorn · 2026-08-03
- 算力资源消耗引争议:AI耗水真比农业和高尔夫球场多吗? — joshwhiton · 2026-08-03
- AI芯片创企 OLIX 获 3.12 亿美元 B 轮融资,估值 33 亿美元 — matthewclifford · 2026-08-03