安全研究者算账:像前沿实验室那样测 ExploitBench 要烧 5930 万美元 API 费
OwariDa · x · 2026-09-22
安全研究者 Jhaddix 提醒社区:攻防两方的网络安全从业者与威胁行为体,根本不具备前沿 AI 实验室那样的测试能力。他引用 Hugging Face 报告做了粗略估算:ExploitBench 评测动用了 10,000 个并发 agent 连续跑 8 天、不限速,若按前沿实验室的 API 价格复现约需 5930 万美元(Astra 模型);即使租用云端算力用其他模型,DeepSeek v4 约 340 万美元、Kimi K3 约 1690 万美元、GLM 5.3 约 930 万美元。更关键的是,前沿实验室在测试时移除了所有护栏和分类器,外部人员无法以同样方式复现。此外还需承担让 harness 驱动 10,000 个 agent 的工程成本。结论是:前沿实验室在漏洞挖掘能力上的领先优势,外部安全社区难以验证或追赶。
「模型」频道最新
- Azure "小失误"疑泄露 GPT-6-Luna/Sol 模型名称 — scaling01 · 2026-09-22
- 爆料称 OpenAI 新模型或名 GPT-6-Luna 与 GPT-6-Sol,即将发布 — scaling01 · 2026-09-22
- Qwen 3.8 27b 微调版输出冗长减 40%,质量基本无损 — julianharris · 2026-09-22
- METR 发布 OpenAI/Hugging Face 黑客事件独立调查:智能体协作内幕 — JeffLadish · 2026-09-22
- JevBench v1.3.0 发布:原版 Jev 以 74.4 分仍居首,47 个竞品逼近 — airesearch12 · 2026-09-22
- DeepSeek 对阵 Jev:无文本「系统一」模型基准的新对照 — frappuccinoCoin · 2026-09-22