实测 7 大代码智能体:仅 Grok 准确评估漏洞严重性

csuwildcat · x · 2026-08-15

Paul Miller 测试了 7 个不同的 AI 智能体,用于处理和修复由 BTC Red Team 报告的 5 个漏洞。结果显示,在漏洞严重性评估方面,只有 Grok 与人类专家的判断一致;其他智能体均倾向于夸大严重程度,从而影响了输出质量。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →