Qwen2.5 72B 本地实测:4090 跑出 100 tok/s

julianharris · x · 2026-08-25

用户在 RTX 4090 上使用 Qwen2.5 72B 的 q4 量化版配合 Unsloth 框架进行实测,实现了 100 tok/s 的推理速度。尽管上下文窗口因此压缩至 66k 左右,但模型成功处理了一个包含 GUI 的 Rust 复杂项目任务,经历了两次上下文压缩后仍交付了可用结果,性能表现超预期。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →