MLPerf Client v2.0 发布:新增图像生成与 Agent 基准测试
TheKanter · x · 2026-08-19
MLCommons 正式发布 MLPerf Client v2.0,这是评估个人电脑 AI 性能的行业标准的重大更新。
主要更新内容:
- 新增图像生成类别:引入 Flux.2 klein 4B 作为实验性测试,评估 PC 的生成式视觉能力。
- 新增 Agent AI 类别:通过软件工程 (SWE) Agent 和数据分析师 Agent 场景来基准测试 Agentic AI 性能,并报告包括 LLM 推理和工具执行时间在内的端到端性能。
- LLM 推理测试升级:将必须测试的模型从 Phi 3.5 mini instruct 升级为 Phi 4 Mini Instruct,并引入 Qwen 3 8B 作为实验性测试。
- 新任务:增加中间摘要任务等更贴近实际的用例。
新版本旨在应对 AI 硬件和软件的快速演进,提供更全面的 PC 性能度量。
「Infra」频道最新
- Brex 数据:增长最快创业公司过半在卖 AI 基础设施而非 AI 产品 — FinanceYF5 · 2026-08-19
- Neon:超 80% 新数据库由 AI Agent 创建,Supabase 也超 60% — FinanceYF5 · 2026-08-19
- Neon称超80%新数据库由AI Agent创建,Agent倒逼基础设施重构 — FinanceYF5 · 2026-08-19
- 创业公司双轨并用:闭源做推理,便宜5–20倍开放模型跑批量任务 — FinanceYF5 · 2026-08-19
- 转向开放模型加速:首购算力间隔从23个月缩至5个月 — FinanceYF5 · 2026-08-19
- 开放模型到可用隔一整层技术栈,每层卖的都是「少操心」 — FinanceYF5 · 2026-08-19