Deepsec 基准评测模型在真实安全审查中的成本与速度
cramforce · x · 2026-07-28
Deepsec 被做成了真实代码库安全评测
这条帖子说,团队把 deepsec 做成了一个 cybersecurity eval,理由是它评测的是一个真实、耗时且有明显成本的任务,因此更接近生产环境。
引用中的要点包括:
- 评测维度是 准确率、成本、速度
- 成本数据和质量权衡可以直接对应真实工作负载
- 在更大的代码库上运行 deepsec,成本会 线性增长
- 这个开源工具不是只扫 PR,而是能对 整个历史代码库 做安全审查,并支持 VM fanout 与 agent sandboxing
引用的基准结果还给出了不同模型的权衡:GPT-5.6 Sol 总分最高,Kimi K3 以约五分之一成本拿到大约一半的最高分,Grok 4.5 则在前十里拥有最好的分/成本比。
「编程与Agent」频道最新
- OpenAI Codex 疑似把 sessions 目录塞满 360GB — HankYeomans · 2026-07-28
- 定价页改成 Markdown,专门给 AI agent 直接解析 — stuffyokodraws · 2026-07-28
- 面向 agent 的搜索引擎称 P50 仅 62ms,快过 Exa 6 倍 — Scobleizer · 2026-07-28
- Kimi K3 上线 Cursor,支持美国推理和零数据保留 — togethercompute · 2026-07-28
- 本地 LLM 代理在 Mac 上以 50ms 节奏操控《Perfect Dark》 — moyoteg · 2026-07-28
- Prompt caching 可把智能体重复请求成本砍半以上 — blaizedsouza · 2026-07-28