SpecFirst框架:让智能体先写需求文档,从零写代码通过率提升21%
centre-for-swe · hf · 2026-07-31
当前的 LLM 智能体在处理已有代码库的工程任务时表现出色,但在从零开始构建程序时依然困难重重。在 ProgramBench 等基准测试中,前沿大模型在仅有自然语言文档和二进制执行文件作为参考时的解决率不到 1%。
为解决这一问题,研究者提出了 SpecFirst 框架。这是一种受经典需求工程启发的两阶段范式:
- 规范提取阶段:专门的智能体首先探测二进制文件,结合文档观察生成结构化的行为规范。
- 代码合成阶段:代码合成智能体基于该规范驱动具体的代码实现。
这种解耦方式能在编码前解决文档歧义,并在合成过程中提供稳定的行为参考。在 ProgramBench 的 200 个实例测试中,SpecFirst 相比单循环基线显著提升了表现:测试通过率提高了 6.9%-21.3%,二进制探索覆盖率提升了 9.4%-18.5%。
「编程与Agent」频道最新
- 从纯文本到多模态:构建多模态 AI 智能体的七步架构指南 — davidad · 2026-07-31
- 从纯文本到多模态:构建多模态 AI 智能体的 7 步架构指南 — MaryamMiradi · 2026-07-31
- Stripe内部AI平台Kai:两周席卷全公司,周活高达83% — emilygsands · 2026-07-31
- YC S26项目Hoplite发布:将本地编码Agent环境无缝迁移至云端 — ycombinator · 2026-07-31
- 单文件纯代码奇迹:Claude 3.5 Opus模拟百万草叶随风摇曳 — heypearlai · 2026-07-31
- 谷歌靠AI单月修复Chrome漏洞超过去两年总和 — TechCrunch AI · 2026-07-31