Fireworks 推出行业实践基准 SII,专用模型漏洞检测召回率达 62.2%
nicolechirps · x · 2026-09-23
Fireworks AI 发布 Specialized Intelligence Index(SII):一个汇总各行业真实工作基准的平台,基准由实际使用模型的从业者团队编写,按质量、成本、任务时长对比开放、闭源与专用模型。
DepthFirst Labs 旗舰模型 dfs-large1(基于 GLM 5.2,与 Fireworks 合作做 RL 后训练)成绩:
- 漏洞检测召回率 62.2%,每任务成本 $6.77
- 差异分析宏召回率 75.6%,每任务成本 $1.34
自称在两项任务上推进了性能-成本前沿。
所属事件:Fireworks 发布 SII 行业实测基准(5 条相关)→
「模型」频道最新
- GPT-6 Astra 对决 Opus 5.5:知识工作碾压,硬核数学仍是 OpenAI 地盘 — johnseach · 2026-09-23
- Polymarket 开盘赌 Claude 6:年内发布概率 91%,明年 3 月仅 37% — Polymarket · 2026-09-23
- Opus 5.5 连续重度使用 5 小时仅耗周额度 4%,降价后用量宽松 — rudrank · 2026-09-23
- 单 prompt 出完整 3D 场景:GPT-6 Sol 极少推理就跑通,四模型横评 — rohanpaul_ai · 2026-09-23
- GPT-6 Sol vs Grok 4.7 等四模型对决:一个 prompt 生成星战 3D 世界 — rohanpaul_ai · 2026-09-23
- Polymarket 早期反馈:Opus 5.5 或已修复 AI「口水文」写作问题 — Polymarket · 2026-09-23