8-16GB 显存新思路:通用模型编排多个领域专家小模型
CyberExplore · reddit · 2026-10-06
发帖者正在从零开始做领域专用本地模型:先用通用预训练+严格后训练得到一个负责推理和生成规格说明的模型,再由专注实现的编码模型简单执行,整体可被编排。核心观点是:MoE 虽激活参数少但整个模型必须驻留显存,对 8-16GB 显卡用户不友好;「一组专家模型 + 通用模型当编排器」 有机会在低端 PC 上打败 MoE,还能并行榨干 GPU。他的硬件是 28GB VRAM(4070 + 5060ti 16GB,x870e 主板),可以做双模型蒸馏和 RL 后训练,并呼吁社区合力训练社区模型。
「Infra」频道最新
- Strata v0.1.40 发布:支持 Strix Halo 与多 GPU 批处理改进 — lxfater · 2026-10-06
- QNX 营收创纪录达 8030 万美元,黑莓转型 AI 嵌入式软件平台 — alysha_lobo · 2026-10-06
- 跑了几十小时端到端基准,Strata 推理服务器在完整构建任务上翻车 — julianharris · 2026-10-06
- R9700 32GB 本地跑 i2v 提速难:用户指 Windows 下 ROCm 表现糟糕 — vladomkd · 2026-10-06
- CutBCE:Google JAX TPU 核消除大规模推荐 BCE 训练 OOM,提速 91.9% — _reachsumit · 2026-10-06
- 纯浏览器跑 37GB Qwen MoE:专家权重从磁盘流式加载,输出对齐 llama.cpp — naklitechie · 2026-10-06