Fireworks 推出专业智能指数,12 家伙伴联合评测真实工作
dr_cintas · x · 2026-09-23
Fireworks 发布 Specialized Intelligence Index (SII),试图用「真实工作」取代静态基准:与在生产环境跑评测的团队合作,首批覆盖医疗、法律、网络安全、客服、生产力、软件等 6-7 个行业,共 12 家启动伙伴。
早期结果亮点:DepthFirst 的 dfbench v1(防御性安全基准,覆盖漏洞检测、验证与差分分析)上,DepthFirst 用 Fireworks RL 后训练的 dfs-large1(GLM 5.2 底座)刷新了 Pareto 前沿,收益来自 RL reward shaping、effort penalty 与 soft finding-budget penalty 等训练技巧。
所属事件:Fireworks 发布 SII 行业实测基准(5 条相关)→
「模型」频道最新
- 博主实测称 Claude Opus 5.5 是当前最强模型,胜过 GPT 6 Sol — petergyang · 2026-09-23
- Baseten 训练负责人解读:RL 延长推理,但泛化依赖领域后训练 — baseten · 2026-09-23
- GPT-6 Sol 与 Opus 5.5 同日发布,Every 团队实测对比 — danshipper · 2026-09-23
- Anthropic Opus 5.5 与 OpenAI GPT-6 Sol/Luna 同期发布,主打降本增效 — Ars Technica AI · 2026-09-23
- 把建筑图纸 PDF 喂给 SOTA 模型生成 3D 漫游:有进步但仍不准确 — mobileraj · 2026-09-23
- Pixel32Bench:让各家大模型盲画 32×32 像素马力欧一决高下 — TheMoonMidas · 2026-09-23