ProgramBench 显示没有模型能完整从零重建软件

zetalyrae · x · 2026-07-25

ProgramBench 评估语言模型能否从零重建程序

这条帖子配图展示了一篇论文:《ProgramBench: Can Language Models Rebuild Programs From Scratch?》,并提到 hashcards 被纳入了研究对象。

论文的核心问题是:现有基准往往只测“修一个 bug”或“补一个功能”这种局部任务,但真实的软件开发需要的是更完整的能力——根据程序和文档,从零设计并实现一个能匹配参考行为的代码库。

图中给出的关键信息包括:

这条信息的价值在于,它把“模型能写代码”的讨论推进到“模型能否从头构建软件”的层面。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →