llama.cpp 合并 PR:支持在 CUDA 上运行三进制 8B 模型
413205 · reddit · 2026-07-30
llama.cpp 已合并一项新的 PR,正式支持在 CUDA 环境下运行 Ternary-Bonsai-8B-Q20.gguf 模型。这意味着开发者可以在 GPU 加速下测试该三进制大模型的实际性能表现。
「Infra」频道最新
- SGLang 联手 Google Cloud,全面支持 TPU 高效推理 — BanghuaZ · 2026-07-30
- 微软 CFO 将 AI 算力比作披萨,分析师批其无视泡沫风险 — TiernanRayTech · 2026-07-30
- Nscale 收购 Anyscale,打造全栈 AI 云平台 — GokuMohandas · 2026-07-30
- AWS财报季前瞻:AI算力瓶颈是否已解除? — tengyanAI · 2026-07-30
- 微软与 Meta 的百亿 GPU 账本:投资回报周期为何大不同? — BenBajarin · 2026-07-30
- 耗资数十亿的模型在推理阶段翻车:一次昂贵的 Bug 排查实录 — joshua_saxe · 2026-07-30