Unsloth 发布 Qwen2.5-72B 新量化模型:1-bit 版仅需 8GB 显存
cephaloform · x · 2026-08-20
Unsloth AI 发布了针对 Qwen2.5-72B 的新 GGUF 量化模型。其动态 V3 版本在 Div-300、KLD 等基准测试中准确率提升超 10%。最引人注目的是,团队同时发布了 1-bit 极致量化版本,仅需 8GB 内存即可运行,且保留了约 77% 的 BF16 精度性能。
「Infra」频道最新
- AWS 靠 AI 基础设施需求延续霸主地位 — DavidLinthicum · 2026-08-20
- 逆向 RK3588 NPU:开源编译器实现 GPT-2 跑出 36 tok/s — one_does_not_just · 2026-08-20
- llama.cpp 集成 dflash2:Qwen 3.8 27B 推理提速至 3 倍 — Top-Eye-8104 · 2026-08-20
- NVIDIA 宣布 9 月举办 FLARE Day 活动 — AllThingsApx · 2026-08-20
- 开发者计费指南:按 Token 付费或比订阅更划算 — heypearlai · 2026-08-20
- Tailscale 复盘:耗时数月追踪 SQLite 16 年陈年 Bug — JeremyCMorgan · 2026-08-20