免费在线 LLM 原理全指南:从 token 到本地部署全链路
JFPuget · x · 2026-09-28
Ahmad Osman 发布的一份免费在线长篇指南,号称是理解 LLM 最完整的入门资料,覆盖两大板块:
模型机制
- 基础概念:token 与 tokenizer、Transformer、注意力机制、KV cache、prefill 与 decode、解码控制
- 工程化内容:model package、chat template、长上下文、RAG、Agent 与工具调用、微调、多模态模型
本地部署实战
- "本地运行"的真实含义、open-weight 与开源的区别
- 量化、VRAM 计算方法、硬件档位选择
- 文件格式与加载安全、运行时与 serving 模式
- 模型选型、隐私、常见失败模式、benchmark 与实用上手路径
适合想系统性补齐 LLM 原理并动手本地跑模型的读者收藏。
「Infra」频道最新
- Fireworks 推理平台后训练 Kimi K3,同质量省 40% 成本 — isidentical · 2026-09-28
- 一个驱动开关让 AMD 双卡 Vulkan 推理提速最高 4 倍 — tabletuser_blogspot · 2026-09-28
- PrismML 三值压缩 Qwen3.8 27B 至 5.9GB,能力保留 98.2% — dl_weekly · 2026-09-28
- 开发者拟让 Codex 决定跑哪些测试,大幅削减 CI 成本 — sull · 2026-09-28
- 向量数据库够用吗?Reddit 热议 Agent 生产级存储难题 — OkShirt9372 · 2026-09-28
- GPU 多到没处用:有人用 PTX 当词表预训练了一个基础模型 — rickasaurus · 2026-09-28