Moonshot 追赶叙事遭质疑
scaling01 · x · 2026-07-17
这条在质疑一件事:MoonshotAI 的公开说法和实际 benchmark 统计不一致。
核心争议是:
- 对外表述里把 Mythos 也算进能力叙事
- 但在真正做基准比较时,又似乎把它忽略掉
- 作者认为如果把“追赶”说得很满,就应该把口径做成可验证、可证伪
转述里还提到一种更强的判断:
- 有人认为 MoonshotAI 可能在今年底前超越 OpenAI 和 Anthropic
- 支持者的说法是中国/ MoonshotAI 正在整体追赶,不只是代码领域
- 甚至包括一些受限模型也在比较范围内
- 作者强调,目前被说成只差 约 1.4 个月 这类说法,本身需要更严谨的证据
这是一条典型的模型能力与 benchmark 口径争议帖。
所属事件:Kimi K3 引爆中国前沿模型再评估(94 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03