用户对比大模型 CPU/RAM 分层加载与 MoE 跑法
Jorlen · reddit · 2026-07-29
一位 Reddit 用户在问:大家是怎么把大模型分层跑在 CPU/RAM + GPU 上的,尤其是那些 MoE 模型在很多层从显存溢到系统内存后,似乎表现不太好。
他在收集真实使用数据,重点包括:
- 跑的是什么模型、什么量化
- CPU / 内存 / GPU 的具体配置
- prefill(提示词处理)和生成速度
- 上下文长度、KV 量化类型、推理软件
他的目的很直接:想判断升级内存值不值,以及当前速度问题到底是软件配置还是硬件组合导致的。
「Infra」频道最新
- Erin Brockovich 发起 AI 数据中心环境调查 — Polymarket · 2026-07-29
- 开源 GIS 工具 GeoLibre 登陆 Google Play — giswqs · 2026-07-29
- ClaudeDev 称无状态 MCP 可部署到 serverless 和边缘 — IndraVahan · 2026-07-29
- 帖子称 AI token 需求到 2030 年或达每月 120 quadrillion — bittingthembits · 2026-07-29
- Cloudflare 为 Workers 增加 OpenTelemetry startActiveSpan — irvinebroque · 2026-07-29
- Ali Ghodsi 与 Andy Konwinski 将谈 agentic AI 基础设施 — dawnsongtweets · 2026-07-29