澄清 Opus 5 的 ARC-AGI 成绩细节与算力趋势换算
imjustnewatai · x · 2026-07-25
作者针对此前关于 Opus 5 推理能力的分析补充了重要的数据精确度与事实细节:
- ARC-AGI-3 成绩澄清: Opus 5 获得的 30.16 分采用的是 RHAE 评估方法,这并不意味着它真正解决了 30% 的游戏关卡。
- J-space 的未知性: 尽管 Anthropic 在 RLHF 之前就发现了模型内部的 J-space 工作区,但官方明确表示其与模型参数规模的关系目前仍属未知。
- 算力与参数的换算: 如果维持每年 5 倍的训练算力增长趋势两年,意味着原始训练 FLOPs 将增加约 25 倍。但按照 Chinchilla 缩放定律,这并不等同于参数量增加 25 倍,而是更接近于活动参数量和训练数据量各增加 5 倍。
所属事件:深扒 Opus 5 隐藏推理机制与 ARC-AGI 成绩(2 条相关)→
「研究」频道最新
- AI 与生物社区将在悉尼讨论可信 AI 与鲁棒性 — suinleelab · 2026-07-25
- 研究发现基因变体会影响 CAR-T 安全性和疗效 — EricTopol · 2026-07-25
- 从监督学习到 agentic world modeling 的完整路线图 — cwolferesearch · 2026-07-25
- Continual RL 工作坊公布录用论文和讲者阵容 — tw_killian · 2026-07-25
- CogSci 讨论语言效率与 LLM 语义表征的关系 — ChrisGPotts · 2026-07-25
- AsyncGRPO 可端到端训练真实编程智能体框架 — dosco · 2026-07-25