开发者实测:用 Agent 搭建自我改进工作流,呼应 Anthropic 递归自改进表态
alexcovo_eth · x · 2026-09-26
开发者 muratcan 分享其医疗语音 agent 系统已实现接近递归自我改进的工作流,与 Anthropic 官方「内部数据显示 Claude 正加速 AI 开发,可能是递归自我改进的路径」的表态形成呼应。其 harness 的自动化闭环包括:
- Agent 写评测:把失败的通话记录转化为带版本的评测场景(来电者人设、目标、应调用的工具、EHR 期望终态)。
- Agent 调用 Agent:模拟来电者在真实房间、真实工具和沙盒 EHR 中,以文本和语音实测已部署的电话前台 agent。
- Agent 评 Agent:LLM judge 加确定性终态检查给每通电话打分,失败按 runtime/工具/检查项聚类,每个根因由 agent 写一个修复和一个新场景,做成堆叠 PR。
- Agent 审查 Agent:审查 agent 批评每个 PR,问题再被修复。
帖子的价值在于展示「Claude 加速 AI 开发」不再是抽象论断,而是医疗场景中可运行的工程实践。
「漫话AGI」频道最新
- Blaise Aguera y Arcas《What Is Intelligence?》出版一周年,获多位科技人士推荐 — soumitrashukla9 · 2026-09-26
- 研究者:对 AI 不必在乐观与悲观间二选一 — nabla_theta · 2026-09-26
- LLM 由人类文字构成,但体验时间与死亡方式全然不同 — qualadder · 2026-09-26
- Leo Gao 自嘲式立场:AI 可能毁灭所有人,但短期提效不冲突 — nabla_theta · 2026-09-26
- 两年实战者发问:AI 内容生成器真能完全无人值守吗? — Cold_Hall_5384 · 2026-09-26
- Dean Ball 吐槽「AI 不能思考」论者,Bluesky 同款论战引共鸣 — moultano · 2026-09-26