Infermeld 开源套件:一张 AMD + 一张 N 卡混跑单个 GGUF 模型
do_u_think_im_spooky · reddit · 2026-10-05
开源项目 Infermeld(v0.1.0 实验版)发布:一个 Linux 配套工具包,基于 llama.cpp,让一张 AMD GPU 和一张 NVIDIA GPU 共同运行同一个 GGUF 模型,无需购买同型号显卡配对。
它提供什么:
- 显式 AMD/Vulkan + NVIDIA/CUDA 设备选择与运行前预检;
- 可复现的构建说明与可审查的启动参数;
- 只读温度守护,关机权限仅限其启动的服务进程;
- 文档与结果站点,公开配置、失败案例与局限。
已测配置:RX 6900 XT(16GB)+ RTX 3080(10GB),Qwen3.6-35B-A3B 的 UD-Q4KM GGUF,Vulkan + CUDA 分层切分,8192 token 上下文预留。
明确的局限:仅在单一硬件对上验证过;持续吞吐和满长度高上下文尚未合格;不保证混卡比单卡快;显存简单相加不代表全部可用。作者招募其他 AMD/NVIDIA 组合的用户复现测试,成败数据都欢迎提交。
「Infra」频道最新
- NCCL 新增对称内存:几行代码提速中小负载集合通信 — StasBekman · 2026-10-05
- 微软 Maia 200 芯片以太网带宽达 1.4TB/s,超 Blackwell 一倍半 — thoefler · 2026-10-05
- VaSE:免训练随机 KV 缓存驱逐法,缓解推理模型内存膨胀 — robinomial · 2026-10-05
- Triton GPU 编程系统课:从 H100 架构讲到 FlashAttention — kalyan_kpl · 2026-10-05
- AWS 推出 Well-Architected Agent,自动扫描 65+ 服务并按业务目标排序风险 — DigitalColmer · 2026-10-05
- 华为已量产381款τ芯片;现代汽车将部署2.5万台Atlas机器人 — 创业邦 · 2026-10-05