降低推理成本新思路:探讨端云协同的模型分割架构

komorra · reddit · 2026-08-10

一位开发者提出了端云协同推理的架构设想,旨在应对当前AI推理成本过高的问题。

核心思路是将闭源/专有模型的推理计算拆分,把部分模型权重或模块保留在客户端本地运行,其余部分放在服务器端。这种做法有望将部分算力负担从数据中心转移到用户硬件上。

实现该方案的一种假设是分别训练客户端和服务器端模型,两者通过网络协议以张量或隐式表征进行通信。作者认为这种标准化的中间通信协议未来甚至能支持一对多、多对多的灵活部署,并就此向社区征求可行性意见。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →