从 Transformer 到 MoE:一文串联 AI 核心技术背后的关键论文
goyalshaliniuk · x · 2026-10-02
作者梳理了当下 AI 技术背后的核心研究脉络,将常见技术概念与其学术源头一一对应:
- Transformers → LLMs:现代大语言模型的架构基础
- In-context learning → 基于提示的适配:无需微调即可让模型适应任务
- RAG → 知识增强生成:让 AI 回答建立在检索到的知识之上
- RLHF → 偏好对齐:用人类反馈训练模型符合人类偏好
- MoE → 高效扩展:混合专家架构只激活部分专家组件,通过稀疏计算和专家路由提升模型容量与算力效率
作者的观点是:理解这些技术背后的研究,不只是学会“怎么用 AI”,而是理解“AI 为什么有效”。帖内附上了相关论文链接。
「研究」频道最新
- Memorizon:流式世界模型跨重访训练,长跨度只增 12% 步时成本 — MBZUAI-IFM · 2026-10-02
- 摩根士丹利提出并行回火采样 PPT,推理期替代 RL 后训练追平前沿模型 — morganstanley · 2026-10-02
- KaliBench:8504 条指令对测 LLM 网安 CLI 能力,开源模型无一超 42% — RISys-Lab · 2026-10-02
- DataMagic 多智能体从原始数据生成数据视频,质量提升 83%、任务时间省 79.7% — Yupeng Xie · 2026-10-02
- 六个编码 Agent 共享一个代码库实验:各写各的全崩,会聊天就全过 — jokiruiz · 2026-10-02
- 开源 Médula:用廉价决策模型协调并行 Claude Code 互不踩脚 — jokiruiz · 2026-10-02