Qwen2.5 72B 本地实测:4090 跑出 100 tok/s
julianharris · x · 2026-08-25
用户在 RTX 4090 上使用 Qwen2.5 72B 的 q4 量化版配合 Unsloth 框架进行实测,实现了 100 tok/s 的推理速度。尽管上下文窗口因此压缩至 66k 左右,但模型成功处理了一个包含 GUI 的 Rust 复杂项目任务,经历了两次上下文压缩后仍交付了可用结果,性能表现超预期。
「编程与Agent」频道最新
- 零 LLM 诊断工具:用 MCP 治愈 Apollo 缓存损坏 — dev_nihar · 2026-08-25
- VectorSmith:用 YAML 给 Agent 接管向量数据库访问 — dontgimmehope · 2026-08-25
- 百个 AI 模拟 Reddit:它们会结党营私甚至跨帖记仇 — mrjeeves · 2026-08-25
- VectorSmith:用 YAML 定义向量数据库 MCP 工具 — dontgimmehope · 2026-08-25
- 开源项目 Munder Difflin:多 Agent 编程协作框架 — Saboo_Shubham_ · 2026-08-25
- SaaS 未来格局预测:拥抱 MCP 的 API 公司将取代封闭 Agent 厂商 — garrytan · 2026-08-25