每日自动选任务跑 23 天:41 次运行 19 次上线,失败 54% 反而是特性
PretendLime6041 · reddit · 2026-09-03
作者分享了一个跑了 23 天的自主 agent 循环:每天早上 6 点 GitHub Actions 触发,agent 读取搜索数据、用量数据和历次尝试日志(含失败原因与成本),生成候选任务、排序后只承诺执行一个,再走计划-实现-测试全流程。
关键机制:任何改动必须通过 81 项自动化检查才能上线,不过关就安静死掉并写入日志,成为次日决策的输入——作者认为这是系统里唯一的「学习」发生处。
8 月 11 日至 9 月 2 日的账目:41 次运行,19 次上线,22 次失败(54% 失败率)。作者主张这个失败率正是特性:如果追求高成功率就得放松检查,回到人工审 diff 的老路。上线的 19 个里 7 个是循环自身机制的改动,12 个是内容页,全部文案由 agent 写就,作者零编辑。
两个观点:
- 自主性不是模型属性,而是「你允许它不经审查就合并多少」,由检查机制而非 prompt 设定。
- 未解难题:任务排序是全流程唯一无法被测试否决的步骤,一个通过全部 81 项检查的坏选择会照常上线。目前只能用尝试日志做滞后代理信号。作者向社区求解:如何评估 agent 的「决策」而非「执行」?
「漫话AGI」频道最新
- 网友:可解释性若成,RL 训练可自动修正失败模式 — mayfer · 2026-09-03
- 六年前书摊难觅 AI 书,如今德国车站书店摆满 AI 主题 — Merzmensch · 2026-09-03
- 一晚 1284 个 agent 任务仅花 4.98 美元,Grok Bot 跑通一人公司 — anirbanbandyo · 2026-09-03
- F. Chollet 断言 AI 必收敛于符号学习,新论文称 LLM 表征隐含符号结构 — burny_tech · 2026-09-03
- AI 妨碍学习?教育圈争论:该教学生正确用而非禁用 — ledwards · 2026-09-03
- Memia 周报:AI 吞噬认知公地,本期 253 条前沿信号 — ben_r · 2026-09-03