Opus 5、隐藏规则推断与 J-space 拼出新代理栈
imjustnewatai · x · 2026-07-25
这条长帖把几个信号串成了一条“未来代理”的技术线索:一是 Opus 5 的系统卡里出现了类似隐藏变量/反射关系的推理迹象;二是一次 ARC 风格 分析里,模型先推导出反射方程,再用 294 个动作 完成 8 级任务,并进一步生成 60 个镜像目标 后才行动;三是一个新 preprint 在 0.5B 到 72B 的 11 个 LLM 上发现,模型规模越大,隐藏规则推断 越强,且在遇到一次矛盾后,更容易修正内部规则并泛化到没见过的情况。
帖子还提到 Anthropic 发现的 J-space:一种在普通预训练中自然形成的小型因果工作区,保留它时模型还能流畅回答,但一旦抑制,多步推理会接近归零。作者据此总结出一条正在成形的栈:预训练 建工作区、规模 强化隐藏规则推断、后训练 教可执行抽象、算力 同时放大训练与测试时搜索。最后还外推了算力增长和 2027–2028 年代理能力的演进方向。
所属事件:深扒 Opus 5 隐藏推理机制与 ARC-AGI 成绩(2 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11