Gemini 3.7 Flash 赢得 THOR 威胁发现基准赛
zacharynado · x · 2026-08-15
Google 发布了 Gemini 3.7 Flash,经 THOR Finding Triage Benchmark 测试,该模型以 72.5% 的得分排名第一,且威胁捕获率达 100%,关键遗漏为 0%。测试对比了 Qwen 3.7 Max、Kimi K3 和 DeepSeek V4,竞品的普遍问题在于误报率过高,即过滤良性或可疑发现的能力不足,而 Gemini 3.7 Flash 正是在降低误报、精准识别威胁方面表现优异。
「模型」频道最新
- 实测:单张 32GB 显卡运行 Qwen3.8-27B 128K 上下文 — WSTangoDelta · 2026-08-15
- 论文揭示 LM Head 成为梯度瓶颈,权重绑定引关注 — JFPuget · 2026-08-15
- 实测:Qwen3.8-27B 双 3090 完整性能数据与配置分享 — No-Statement-0001 · 2026-08-15
- 代码世界模型CWM:超越静态代码预测 — bendee983 · 2026-08-15
- 本地无审查版Qwen 3.8 27B发布,号称Opus 4.6级 — Temporary_Idea8880 · 2026-08-15
- Qwen 3.8 现已在 Bittensor Subnet 95 上线 — markjeffrey · 2026-08-15