DepthFirst 发布 dfbench,评测大模型防御性安全能力
andreamichi · x · 2026-08-20
安全团队 DepthFirst 推出了 dfbench,这是一个用于评估前沿模型和智能体系统的防御性网络安全基准。该基准专注于检测、验证和差异分析三个目标,衡量智能体是否能在可持续成本下提供可操作的安全覆盖,并包含 GPT、Gemini 等模型在 Recall 和 Precision 上的图表对比。
「研究」频道最新
- 论文 FRONT 3.1:引入“数字躯体”与稳态驱动的认知架构 — Sufficient-War4616 · 2026-08-20
- 小模型 CNN 可靠检测图像生成源 — kwangmoo_yi · 2026-08-20
- Elad Gil 用 Claude 与 OpenAI 分析微塑料健康影响 — juliey4 · 2026-08-20
- Wired 现场:机器人即兴用香蕉当工具完成任务 — nordicinst · 2026-08-20
- 作者详解「混合宽度」嵌套子模型设计:自由度更多但选配置更难 — nthngdy · 2026-08-20
- 伯克利提出 CLIFT 法,闭源模型也能闭环微调人形机器人 — keerthanpg · 2026-08-20