用24GB内存运行193B参数模型:8个专家模型动态路由实现

Similar_Wealth_1850 · reddit · 2026-08-06

开发者分享如何用24GB内存运行193B参数模型。方案是8个专用LLM(分诊、路由、控制、数学、代码、推理、通用、视觉)在单台消费级机器上运行,通过动态加载确保同一时刻只有一个模型活跃。路由分两阶段:零成本正则扫描和轻量分诊模型。在Medium配置(66B总参数,≤14B活跃)上HumanEval达92%,Large配置(193B总参数,≤32B活跃)达95% HumanEval和94% MATH。作者强调专业化+动态加载优于单体扩展。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →