Hugging Face 团队出新书《Building VLMs》:手把手教你构建视觉语言模型
andimarafioti · x · 2026-09-16
Hugging Face 多模态团队成员 Merve Noyan、Miquel Farré、Andrés Marafioti 与 Orr Zohar 合著的新书《Vision-Language Models — Building VLMs with Hugging Face》正式开售,已可在 Amazon 购买纸质版、在 O'Reilly 在线阅读,并附带开源代码与 Notebook。
- 定位:作者称这是当年多模态从研究玩具变成工程问题时他们想拥有却找不到的书,实践指导散落在博客、文档与圈内口口相传中,本书试图系统补齐。
- 面向人群:ML 工程师可用 PyTorch + Hugging Face 实例学习训练、微调与部署 VLM;研究者可理解核心架构、批判性读 VLM 论文;开发者可从 API 用户进阶为系统设计者。
- 风格:以代码和具体示例为主,理论只用来解释机制为何成立。
Julien Chaumond(julienc)转发推荐,Merve Noyan 也自荐称这是她最喜欢的作品。
「多模态」频道最新
- FiCA 论文:单张人像照片秒生成可驱动的高斯 Codec 虚拟形象 — rsasaki0109 · 2026-09-16
- InclusionAI 发布 LLaDA-Image:6B 全扩散架构,90% 训练只用图片 — jiqizhixin · 2026-09-16
- MiniMax H3 动态图形实验走红,附带 5 万美元挑战赛 — egeberkina · 2026-09-16
- Suno 丢和弦后他自建转换器,让 YuE2 保留全部和声 — Saren-WTAKO · 2026-09-16
- Hugging Face 发布 3D 生成生态指南:讲清各类 3D 表示的取舍 — unofficialmerve · 2026-09-16
- 作者分享 Midjourney v8.2 四个虚构 token,可玩出隐喻画面 — LudovicCreator · 2026-09-16