MiniMax M3 内幕:实习生设计稀疏注意力,百万 token 上下文
AI Engineer · youtube · 2026-09-04
Hugging Face 联合创始人 Thomas Wolf 与 MiniMax RL 负责人 Olive Song 在 AI Engineer World's Fair 对谈,拆解 MiniMax M3 的设计:
- 为什么 agent 需要百万 token 上下文:短上下文撑不住长对话、工具返回与复杂环境;M3 结合功能性百万 token 窗口与编码、agentic、多模态能力,同一模型可理解文本、图像和视频。
- 实习生设计的稀疏注意力:M3 背后的稀疏注意力架构出自一位实习生之手。
- 从第一步就做原生多模态训练,以及训练出错时会发生什么。
- 开源文化与产品:MiniMax 产品服务约 3 亿用户,坚持持续开源;社区反馈帮助改进模型,内部 agent harness 反过来加速自家研究——M3 已在辅助团队构建 M3.1。
- 下一步:多智能体系统。
「模型」频道最新
- AI编程订阅性价比图更新:按AA智能指数4.2对比$20/$200档 — popiazaza · 2026-09-05
- 给 Fable 5.1 写肢体动作标记,对话体验明显更顺 — repligate · 2026-09-05
- 用户发现Astra仅出现在Windows版ChatGPT/Codex,同账号Mac没有 — cheesecakegood · 2026-09-05
- GPT-6 Astra 发布日额度不重置,用户抱怨 OpenAI 用量政策 — tobowers · 2026-09-05
- 模型会模糊记住「概念」而非原文:一场关于 SAE 特征与记忆的争论 — voooooogel · 2026-09-05
- 博主丢 PPT 模版给 GPT6 Astra,30 页大会幻灯片连头像都做对了 — vista8 · 2026-09-05