SpecFirst框架:让智能体先写需求文档,从零写代码通过率提升21%

centre-for-swe · hf · 2026-07-31

当前的 LLM 智能体在处理已有代码库的工程任务时表现出色,但在从零开始构建程序时依然困难重重。在 ProgramBench 等基准测试中,前沿大模型在仅有自然语言文档和二进制执行文件作为参考时的解决率不到 1%。

为解决这一问题,研究者提出了 SpecFirst 框架。这是一种受经典需求工程启发的两阶段范式:

这种解耦方式能在编码前解决文档歧义,并在合成过程中提供稳定的行为参考。在 ProgramBench 的 200 个实例测试中,SpecFirst 相比单循环基线显著提升了表现:测试通过率提高了 6.9%-21.3%,二进制探索覆盖率提升了 9.4%-18.5%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →