Opus 5、隐藏规则推断与 J-space 拼出新代理栈
imjustnewatai · x · 2026-07-25
这条长帖把几个信号串成了一条“未来代理”的技术线索:一是 Opus 5 的系统卡里出现了类似隐藏变量/反射关系的推理迹象;二是一次 ARC 风格 分析里,模型先推导出反射方程,再用 294 个动作 完成 8 级任务,并进一步生成 60 个镜像目标 后才行动;三是一个新 preprint 在 0.5B 到 72B 的 11 个 LLM 上发现,模型规模越大,隐藏规则推断 越强,且在遇到一次矛盾后,更容易修正内部规则并泛化到没见过的情况。
帖子还提到 Anthropic 发现的 J-space:一种在普通预训练中自然形成的小型因果工作区,保留它时模型还能流畅回答,但一旦抑制,多步推理会接近归零。作者据此总结出一条正在成形的栈:预训练 建工作区、规模 强化隐藏规则推断、后训练 教可执行抽象、算力 同时放大训练与测试时搜索。最后还外推了算力增长和 2027–2028 年代理能力的演进方向。
所属事件:深扒 Opus 5 隐藏推理机制与 ARC-AGI 成绩(2 条相关)→
「模型」频道最新
- Opus 5 无工具拿下 IMO 2026 42/42 — Afinetheorem · 2026-07-25
- 马斯克称 Grok 4.6 两周内到,4.7 四周内到 — Acceptable-Debt-294 · 2026-07-25
- Quadrillion 实测:Opus 5 在 ML 任务上快过 Opus 4.8 — igarciacamargo · 2026-07-25
- Google 在多数基准上落后于开源权重模型 — burny_tech · 2026-07-25
- Claude Opus 5 在代码智能体基准拿到 67 分 — Hesamation · 2026-07-25
- 同规模对比评测显示:扩散模型整体落后,但在智能体循环更快 — Additional-Engine402 · 2026-07-25