专题 · FULL STORY

Reflection AI 首个开源模型 Beam 从预热到落地

英伟达投资、由前 DeepMind 研究员创办的 Reflection AI 先被曝将发布首个开放权重模型,剑指中国开源阵营;10 月 6 日 Beam 模型(501B 参数)正式发布并宣布月内开放权重,随后社区实测褒贬不一,有人认可其效率,也有人认为不敌 DeepSeek 等中国模型。

2026-10-04 ~ 2026-10-06 · 3 集 · 45 条

第 1 集 · 英伟达投资的 Reflection 将发首个开放权重模型,剑指中国开源阵营(2026-10-04,14 条)

据 Axios 独家报道,获英伟达投资、由两位前 Google DeepMind 研究员创办的初创公司 Reflection 即将发布其首个开放权重(open-weight)模型,据称能力极强,意在同时挑战美国 AI 巨头与 DeepSeek、Qwen 等中国新兴开源对手,但初期预计仍落后于美国最强的前沿闭源系统。ivanbezdomny 转述 HuggingNews 整合报道称,企业本月起即可下载该模型并用自有私有数据进行定制。

已确认

  • 消息来源为 Axios 独家报道,援引知情人士:Reflection 正准备发布一个强大的开放权重模型,可与最顶尖的中国开源模型竞争,但初期仍落后于美国最强前沿系统(m1、m2、m5、m8、m13)。
  • 公司由两位前 Google DeepMind 研究员创办,获英伟达投资(m10 及多个转发帖)。
  • 算力方面,Reflection 自 7 月起每月向 Elon Musk 支付约 1.5 亿美元租用 Colossus 算力;与 Nebius 签订超 10 亿美元算力协议,并据称与 SpaceX 签署大型算力协议(m4、m9、m10)。
  • ivanbezdomny 援引 HuggingNews 称,该模型相关算力总投入已承诺超 70 亿美元,企业本月起即可下载并用私有数据定制(m12、m13)。
  • Axios 称本月将有更多美国实验室跟进发布开源权重模型(m3、m5、m7)。

尚未确认

  • 模型的具体发布时间、参数规模、性能基准等细节尚未披露,Axios 报道也注明细节仍在陆续披露中。
  • 「同时威胁中美双方巨头」等说法为媒体与转发者的解读性表述,实际竞争力有待模型发布后验证。ShakeelHashim 亦认为该报道写法颇为奇怪,但爆料本身值得关注(m11)。

为什么重要

  • 若属实,这将是美国阵营在开源权重方向对标中国顶尖开源模型的又一重要动作,可能改变当前由 DeepSeek、Qwen 等主导的开源竞争格局。
  • VraserX 评论称,美国市场需要更多认真的开放权重模型,而非更多 200B 左右的中等模型;mindwip 则希望参数规模在 200B 以下,并注意到有更多西方开放模型动向。
  • 超 70 亿美元的算力承诺规模罕见,叠加与 Musk 的 Colossus 租约及 Nebius、SpaceX 协议,显示该创业公司押注力度之大,也与英伟达的投资关系形成联动。其商业定位是让企业用自有数据和算力构建成本更低、控制力更强的定制化 AI 系统。menhguin 感慨,2023 年时 OpenAI 还在聊天机器人领域一骑绝尘,如今竞争格局已大不相同。

第 2 集 · Reflection AI 发布首个开源模型 Beam,501B 参数月内开放权重(2026-10-06,27 条)

10 月 6 日,Reflection AI(创始人 Misha Laskin,Nvidia 支持的纽约初创公司,由前 DeepMind/Google 研究员创立)正式官宣其首个开源权重模型 Beam。该模型为纯文本稀疏 MoE 架构,总参数 501B、激活参数仅 23B,定位面向编码、智能体(agentic)与科学任务的「主力型」开源模型,完整权重将于本月内以 Apache 2.0 许可发布。官方宣称其完成任务的 token 效率比 GLM 5.2 高 3-4 倍,比领先西方闭源模型也有优势。发布时模型处于红队测试最后阶段,实际性能仍待社区实测验证。

已确认

  • 架构为纯文本稀疏 MoE,总参数 501B、激活 23B(A23B),端到端从零预训练
  • 预训练使用 23.8 万亿精选 token(网页数据与专有授权数据),耗时约一年;据 @gethackteam 转述,训练还包含亿级 rollout 的强化学习,并另完成了扩展的 mid-training 阶段
  • 据转发帖(@Madisonkanna),效率来源包括用 RL 长度惩罚抑制冗余 token 与稀疏 MoE;据转发帖(@brandondamos),团队花一年扩展生产级 RL/OPD 栈,在 1 万张 GB300 上稳定运行
  • 团队称其推理 token 效率较高,在编程与 agentic 任务上推进了「西方开源前沿」
  • 完整权重本月内以 Apache 2.0 许可发布,并附带完整文档与运行、评测、微调全栈工具
  • 目标用户为企业、政府和开发者
  • 据转述的第三方观察(@gethackteam),Beam 跑分落在 Qwen 3.8 与 GLM 5.2 之间,与 GLM 5.2 有竞争力、接近 Qwen 同级模型

尚未确认

  • 官方宣称的「效率达 GLM 5.2 的 3-4 倍」为团队自述,尚无独立评测佐证
  • @nmasc 指出具体规格与评测成绩有待进一步确认
  • 据转发帖(@Madisonkanna)转述,训练耗资或达 4000 万美元,该数字未经官方证实

为什么重要

Beam 是 Reflection AI 的首个公开模型,以 500B 级参数规模进入开源阵营,直接对标 GLM、Kimi、DeepSeek、Qwen 等当前主流开源前沿模型,被多方视为西方对中国开源模型领先优势的回应。据员工 alexpolozov(经 @bhutanisanyam1 转述),他去年 11 月加入时预训练团队仅 5-10 人,公司没有爬虫、GPU 基础设施、去重管线和内部评测,这些能力均为后续从零搭建,一年内完成从零预训练侧面反映了开源前沿竞争的加速。Apache 2.0 许可与本月内的时间表意味着实际可用性与实测表现值得持续关注。

还有 7 条相关讨论 →

第 3 集 · 开源新模型 Beam 被指不敌 DeepSeek 等中国模型(2026-10-06,4 条)

初创公司 Beam 发布首个开源模型,宣称「推进了西方开放权重前沿」,激活参数与 token 效率获部分 KOL 认可,称其可与 GLM 5.2 竞争。但开发者 Bindu Reddy 等评测指出,Beam 基准成绩不佳,表现落后于 DeepSeek Flash 等「好得难以置信」的中国模型,The TuringPost 实测也显示其在多项关键编码基准上明显落后 Qwen、DeepSeek。Beam 方面回应称这是公司的第一个模型,尚无大厂那样的完整 scaling ladder 积累。