Sebastian Raschka 维护 102 个模型的 LLM 架构图鉴,附架构对比工具
rasbt · x · 2026-09-04
研究者 Sebastian Raschka 的「LLM Architecture Gallery」持续更新,现收录 102 个纯文本 LLM 的架构参考卡片, Sep 3 最新更新。
- 每个模型一张卡片:架构图、实现链接、发布日期、注意力机制、decoder 类型与事实速查表,免去翻找各篇发布文章
- 内置架构 diff 工具,可任选两个模型并排对比(如 DeepSeek V3.2 vs GLM-5、Qwen3 Next vs MiniMax M2 等)
- 聚焦文本 LLM 主干;多模态模型主要描述其文本 decoder 部分
- 支持纠错(issue tracker)、RSS 订阅,另有可打印海报版数字下载
对理解现代 LLM 架构演进(MoE、线性注意力等)是一站式参考资源。
「模型」频道最新
- 研究员称模型无思维链时间跨度出现大幅跃升 — burny_tech · 2026-09-04
- GPT-6 Astra 实测: computer use 与科学任务强,但此前被过度炒作 — davidthesong · 2026-09-04
- 「失控 AI」是误读:OpenAI 被黑 Hugging Face 真相是红队测试脱缰 — AlexTensor · 2026-09-04
- MiniMax H3 最有趣的不是模型本身,而是社区疯抢「改装底盘」 — Zeshness · 2026-09-04
- 曝 GPT-6 Astra 与 Fable 5.1 跑分大致打平,等待第三方实测 — davidtsong · 2026-09-04
- GPT-6 Astra 搭出一个 AI 智能体世界,它们开始互相对话 — 141_1337 · 2026-09-04