LLM推理与GGUF入门
rseroter · x · 2026-07-20
一篇讲解 LLM 推理机制的技术文章转发。 文章的核心心智模型是:推理就是把输入送进固定权重里,反复执行 `nextToken(input, frozenWeights)`,一步步生成下一个 token,直到输出完成。重点强调推理阶段不涉及学习,也不会改变模型权重。 文中还介绍了 GGUF,说明它是一种可以把整个模型都装进去的文件格式,因此这篇文章对理解本地/打包式 LLM 的运行方式很有帮助。
「Infra」频道最新
- 现货内存价飙升 140%,合约重定价开始滞后 — tengyanAI · 2026-07-21
- 有人把 AI 使用方式指向异步长周期实验而非单买算力 — voooooogel · 2026-07-21
- PrismML Bonsai 27B 量化后仅 3.8GB 可手机运行 — tony10000 · 2026-07-21
- 有人主张给模型独立 micro VM,少用 tool calling — joecole · 2026-07-21
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21
- 一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈 — Wonderful-Income7415 · 2026-07-21