Artificial Analysis 开源本地 Agent 推理基准,首测 DGX Spark 与 M5 Pro
ArtificialAnlys · x · 2026-09-30
Artificial Analysis 开源了 AA-AgentPerf-Local,一款测试 AI 模型在本地笔记本/工作站上以 agent 方式运行速度的基准工具,并发布 NVIDIA DGX Spark (128GB)、RTX 5090 (32GB)、AMD Ryzen AI Halo (128GB)、MacBook Pro M5 Pro (64GB) 的初始结果。
工作原理
- 回放真实 agent 会话:默认工作负载为 8 个录制的 agent 任务、共 168 轮模型调用,每轮请求携带完整上下文(增长至约 56K tokens),每轮生成固定数量 token,保证各系统工作量一致
- 默认跳过工具执行以隔离推理速度;也可回放真实工具延迟或在 CPU 上实时跑工具调用
- 支持任何 OpenAI 兼容推理服务器,可测任意模型与配置
首发模型:Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B、Ling 3.0 Flash (124B/5B active),均为 4-bit 量化,覆盖稠密与 MoE 架构。硬件覆盖 CUDA、ROCm、Vulkan、Metal 四种平台。该机构此前已覆盖手机和数据中心硬件,此番扩展至笔记本与工作站,后续还将加入 RTX PRO 6000 Blackwell 等设备。
「编程与Agent」频道最新
- Cube 发布:2 分钟开一台云电脑,让 Claude Code 合盖继续跑 — algo_diver · 2026-09-30
- 新玩法:自举「最优结果形状」的自动研究循环 — burny_tech · 2026-09-30
- Stack Overflow 现身 OpenAI DevDay,谈 Codex 助力新架构 — pchandrasekar · 2026-09-30
- 模型变强≠可删封装层:反方观点称复杂 agent 外壳仍在烧 token — max_paperclips · 2026-09-30
- 用 Groq + Hindsight 搭一个能从反馈中学习的代码审查 Agent — pasulabhavya · 2026-09-30
- OpenAI Dots 开源复刻 Open-Dots 24 小时斩获 4500+ GitHub 星 — matchaman11 · 2026-09-30