SII 不是一次性榜单:模型更新即重测,伙伴可提交生产评测
dr_cintas · x · 2026-09-23
Fireworks 对 Specialized Intelligence Index (SII) 的补充说明:
- 持续更新:SII 不是一次性快照,新模型发布即更新成绩;伙伴可提交已在生产环境运行的评测,使榜单始终反映最新模型在真实工作上的表现。
- 首批 7 个领域:医疗、法律、金融、网络安全、客服、生产力、软件,之后还会增加。
- 方法论依据:引用 METR 的研究——4 位维护者审查了来自 3 个 SWE-bench Verified 仓库的 296 个 AI 生成 PR,维护者接受率比自动化基准分数平均低 24.2 个百分点,「许多通过 SWE-bench 的 PR 不会被合并进主分支」,以此论证公共基准无法衡量真实工作。
- 同时开放社区提交基准或模型,并预告了 Forge 2026 会议。
所属事件:Fireworks 发布 SII 行业实测基准(5 条相关)→
「模型」频道最新
- 观点:十年前的专家看到今天模型会宣称 AGI 已实现 — JacksonKernion · 2026-09-23
- 为省额度折腾模型切换:Reddit 用户称便宜 swarm 模型组合效果不错 — AnotherWallace · 2026-09-23
- 用户吐槽 Anthropic 新模型:自动路由到 fable、仍锁定 cyber — BLUECOW009 · 2026-09-23
- 爆料:Qwen4-35B-A3B 已在测试,尚未官宣 — AIFlow_ML · 2026-09-23
- 网传 Opus 5.5 系内部教师模型蒸馏产物,甚至称「首个 RSI 训练模型」 — ivan_bezdomny · 2026-09-23
- Hamel Husain 实测:用 Opus 5.5 测试 AI 写作是否告别「slop」 — HamelHusain · 2026-09-23