实测 Astra 玩约 30 款冷门解谜游戏,ARC-AGI-3 得分或被低估
burny_tech · x · 2026-09-09
博主 FakePsyho 在沙箱环境下测试 Astra 的推理能力:无网络、无代码工具,让 Astra+codex 玩了约 30 款 obscure 的 puzzlescript 解谜游戏,包括规则发现和高难度关卡。
主要观察:
- Astra 无需写代码即可完成寻路/规划,单批常能连续执行 20-30 步动作,接近专家级解谜玩家水平。
- 失误模式非常「人类化」:比如选择思考量更少但路径更长的方案,因此作者推测其底层并没有代码执行机制。
- 作者认为其在 ARC-AGI-3 上约 99% 的成绩可能还低估了实际能力,整体表现已高于普通人类玩家。
「模型」频道最新
- GPT 6 Astra 20分钟一发复刻童年游戏 Re-Volt 并自行试玩 — nickbaumann_ · 2026-09-09
- 扎克伯格:Meta 已开始训练 Watermelon 之后的更大模型 — rohanpaul_ai · 2026-09-09
- 开发者泼冷水:Astra 确实不错,但擅长 Blender 不等于 AGI 到来 — carsonfarmer · 2026-09-09
- Meta Muse Spark 1.3 Max 重塑 WebDev 竞技场性价比前沿,登第 8 名 — arena · 2026-09-09
- Cohere 创始人爆料:ZDR 也挡不住大厂用你的衍生数据训练 — josh_wills · 2026-09-09
- 网友:Open Problems 数学题被做成 RL 环境,与 benchmark 本为一体 — burny_tech · 2026-09-09