FrontierCode:衡量代码能否被合并的新基准

elie · x · 2026-07-04

新基准 FrontierCode 发布,超越「代码是否正确」,重点评估代码是否足够好、人类是否愿意接受合并——关注效率、可读性、可复用性,因为可持续项目需要这样的代码。报告还透露一个隐藏发现:算力扩展越过某个阈值后,目前反而出现收益递减甚至负收益,值得观察这是否只是当下训练实践的产物。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →