网络威胁情报团队把 fast16 调查做成了多阶段 benchmark
vijaybolina · x · 2026-07-23
一组做网络威胁情报的实践者表示,他们把一次 fast16 调查改造成了一个 多阶段 benchmark,用来测试所谓“前沿级智能”在真实场景里到底能做到什么。
他们认为,传统的编程 benchmark 或漏洞研究题并不能覆盖威胁情报工作的核心流程,所以专门按自己的实战工作流设计了这套评测。
「研究」频道最新
- 做了一年的个人 agent,最后输给一天新的版本 — Antony_Richards · 2026-07-23
- Inkling 在 AA-Briefcase 得 836 分,落后顶级开源模型 — ArtificialAnlys · 2026-07-23
- 机器人论文称 VLA 和 world model 还不够 — hbouammar · 2026-07-23
- Google Research:让量子计算机从错误中学习 — donutloop · 2026-07-23
- Derya Unutmaz:AI 正把生物医学研究压缩到几天 — DeryaTR_ · 2026-07-23
- 应用数学主导AI浪潮,为何梯度下降依然有效? — fkasummer · 2026-07-23