Grok 4.7 网络安全实测:59% 召回,成本仅 GPT 竞品一半
andreamichi · x · 2026-09-22
Depth First Labs 获得早期访问权限,对 Grok 4.7 的网络防御红队能力在 dfbench 上做了评测。
- 防御性网络安全任务上表现扎实:召回率 59%,精确率 23.9%,兼顾查全与查准
- 成本优势明显:约为 GPT 5.6 Sol 的一半、Mythos 5 的五分之一
- 评测者认为它是不错的网络安全模型,进展速度快
「模型」频道最新
- mimo-v2.6-pro 被指改写性价比帕累托前沿 — zainhas · 2026-09-22
- 爆料称 Grok 4.7 已发布,单任务成本反超 GPT — ChrisGPT · 2026-09-22
- 小米 MiMo v2.6-Flash-RL 对比同量级开源模型,评测图表出炉 — ababaka · 2026-09-22
- 小米 MiMo v2.6 Pro 与 Flash 发布,主打编程场景 — No-Selection2972 · 2026-09-22
- 开发者感叹:Claude 为何不能像 Ampcode 那样简洁回复 — HankYeomans · 2026-09-22
- 开发者整理 607 个 Jev 用例,按成本延迟区分 demo 与生产级 — Sarthak999gupta · 2026-09-22