codex+astra 攻克 MazeBench:静态 BFS 求解器两小时拿 44 颗宝石
xeophon · x · 2026-09-12
xeophon 转发了 FakePsyho 在 MazeBench(迷宫测试)上用 codex 搭配 astra xhigh 的实验进展:
- 设定:agent 可直接访问源代码,无视觉组件,难度大幅低于官方测试;全程放开代码使用,几乎零人工干预——作者只在开头概述了「固定 BFS 求解器逐房间求解 + 全局拼接」的思路,之后就放手让 agent 自己跑。
- 结果:纯静态求解器在 5.6-sol 上约 2 小时(单 CPU)拿到 36 颗宝石;astra 的静态求解器同样时间拿到 44 颗(作者认为部分原因是中途从 5.6-sol 的 44 颗卡点续跑)。
- 意义:这是对「优化过的经典算法 + 最小化提示」能让 coding agent 在测试类任务上走多远的一次探底实验,展示了 agent 编排经典求解器的工作流。
「编程与Agent」频道最新
- 实践发现单台 VM 承载多个持久化 Agent 效果不错 — remilouf · 2026-09-12
- Codex 再现借口式限流暂停,开发者改用另一 agent 代管会话 — doodlestein · 2026-09-12
- 开发者晒多 agent 工作流:Telegram 五话题群+GitHub issue 自动派生 agent — granawkins · 2026-09-12
- 开发者分享:3 个 agent 并行,prompt 写成五段长文驱动 30 分钟工作量 — granawkins · 2026-09-12
- Design Check 新增纯文本检测,专抓 AI 味营销文案 — atp_studio_coll · 2026-09-12
- 公司转向 agent 架构后:API 调用若走 Sonnet 5 每天要烧一两千美元 — nunodonato · 2026-09-12