图表显示 ARC-AGI-1 竟比 ARC-AGI-3 更难攻克
burny_tech · x · 2026-09-04
FakePsyho 发布图表并称「现在可以官宣了:ARC-AGI-1 比 ARC-AGI-3 更难」。这一反直觉结论指的是新版 ARC-AGI-3 因任务设计偏「可被推理模型攻克」而实际难度反而低于老基准 ARC-AGI-1,引发社区对基准设计有效性的讨论。
「研究」频道最新
- Kangwook Lee 澄清:智能体足够强时 harness 可在 rollout 中自行进化 — Kangwook_Lee · 2026-09-04
- 用贝叶斯 Bandit 从数学上定义「好奇心」 — CatAstro_Piyush · 2026-09-04
- 《百页语言模型书》出暗黑版:用数学、插图与代码讲透 LLM — burkov · 2026-09-04
- 阿里 CORE 论文:用 Reranker 蒸馏提升多模态嵌入的组合推理 — Alibaba-NLP · 2026-09-04
- On-policy 蒸馏再思考:单个样本即可持续提升,缺的是算法而非数据 — Thinking-Space · 2026-09-04
- WorldReward:用视觉-语言奖励模型评估相机条件世界模型 — Yibin Wang · 2026-09-04