代码审查基准:100%召回漏洞

gabrielchua · x · 2026-07-15

转发内容提到一个名为 Dam Secure benchmark 的评测:在 PR 里植入访问控制漏洞后,GPT-5.6 Sol 做到了 100% recall,单次 review 成本约 $0.70。

这条信息的重点不是模型宣传,而是它在 代码审查/安全缺陷发现 场景里的效果和成本表现,属于比较具体的工程评测信号。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →