9周代码生成对比:执行顺序决定成功与否

Ok_Astronomer_526 · reddit · 2026-08-31

用户进行了为期9周的重复代码生成实验,每周使用相同的Repo、提示词和Claude模型来生成OpenAPI客户端。唯一的变化是保存了每次运行的执行计划。通过对比发现,9次计划几乎完全一致,唯有一个步骤的顺序不同:更新共享测试固件是在调用点之前还是之后。其中6次将固件更新放在前面,最终类型检查一次通过;而3次放在后面的则失败并需重试。尽管每周的Spec差异极小,且提示词未提及固件,但这一个步骤的随机变动显著影响了结果。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →