Mesh LLM:多机拼成一个本地模型服务
thisguyknowsai · x · 2026-07-13
Mesh LLM 的思路是把你已有的多台电脑拼成一个服务,像本地单机一样调用大模型。它会先判断单机能不能承载;如果不行,就把模型按层切分,分布到多个节点上,由协调器负责规划层范围、拉起后续阶段,再对外提供一个 OpenAI 兼容接口 http://localhost:9337/v1。
帖文还提到几个关键点:
- 如果单机就能跑,直接本机执行,没有 mesh 开销。
- 如果模型太大,Skippy 阶段会把模型切成片段分发到不同机器。
- 节点只下载自己负责的层片段,而不是整个模型。
- 目前已有 72 个模型家族通过认证,覆盖 89 条兼容矩阵记录。
支持的模型包括 Qwen、Llama、Gemma、Mistral、DeepSeek、GLM、Phi、Cohere、Falcon 等,也支持像 Qwen3-VL、DeepSeek-OCR 这样的多模态拆分服务。Mesh 可以私有邀请使用,也可以通过 Nostr 公共发现。
所属事件:Mesh LLM 将多机拼成本地大模型服务(4 条相关)→
「Infra」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11