ARC-AGI-3 机制澄清:单次运行不共享状态,评分仅计最终动作
xeophon · x · 2026-08-07
针对外界对 ARC-AGI-3 评测机制的疑问,xeophon 引用官方说明进行了澄清:
- 单次运行:模型对每个游戏只有一次运行机会,无法通过多次尝试“重启”或跨次学习。
- 计算与评分:模型可以消耗额外算力来思考当前局面,但 RHAE 评分会计算这些动作成本。Kaggle 挑战赛中的评分会计算进化过程中的所有动作,但单次采样间的进化状态是不共享的。
- 测试时训练(TTT):这种机制类似于 ARC-AGI-2 中使用的 TTT,区别在于这里是学习技能而不是修改模型权重。
「研究」频道最新
- 生成式 AI 成功设计出完整且可存活的噬菌体基因组 — bravo_abad · 2026-08-07
- 研究植入陷阱诊断 AI Agent 选错工具原因 — alex_verem · 2026-08-07
- 研究揭示前沿 AI 模型易被“吹嘘式”工具描述欺骗 — alex_verem · 2026-08-07
- 实测 12 款开源重排模型:AI 搜索为何更爱引用清单体? — metehan777 · 2026-08-07
- 上海实验室发布 BigBang-v1:36B 自演化大模型 — AdinaYakup · 2026-08-07
- NVIDIA 团队打造数据分析 Agent,登顶 DABStep 榜单 — JFPuget · 2026-08-07