Deepsec 基准评测模型在真实安全审查中的成本与速度

cramforce · x · 2026-07-28

Deepsec 被做成了真实代码库安全评测

这条帖子说,团队把 deepsec 做成了一个 cybersecurity eval,理由是它评测的是一个真实、耗时且有明显成本的任务,因此更接近生产环境。

引用中的要点包括:

引用的基准结果还给出了不同模型的权衡:GPT-5.6 Sol 总分最高,Kimi K3 以约五分之一成本拿到大约一半的最高分,Grok 4.5 则在前十里拥有最好的分/成本比。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →