一个 AI 拳击 benchmark 记录速度、延迟和闪避准确率
jerkosaur · reddit · 2026-08-04
作者在做一个物理规则驱动的 AI 拳击 benchmark,想用更有趣的方式测试模型的决策速度、适应能力和策略。
设定
- 给 LLM 输入比赛状态;如果模型支持视觉,就再喂图像信息
- 直到裁判数到 10,或倒地后累计掉血达到 50%,才算输
- 目标是做一个比常规 benchmark 更好玩的评测
目前在测的指标
速度与延迟
- tokens/s / 吞吐
- 端到端延迟
- 对对手动作预兆的反应延迟
动作质量
- 工具调用正确率 / 是否输出合法动作
- 无效动作恢复能力
- 耐力效率:单位耐力造成多少伤害
策略与状态感知
- 命中率:有多少攻击完全打空
- 格挡 / 闪避成功率
- 情境相关性:血量很低时行为是否真的更保守
作者还提到,Gemini Flash Live 因为速度和视觉支持更适合这类实时测试;本地模型在 5060 Ti 8GB 上推理偏慢,可能需要做时间缩放补偿。
「模型」频道最新
- 传 OpenAI 内部版 Astra 已解十个数学与计算机难题 — PolarBearby · 2026-08-04
- OpenAI 重建 ChatGPT 语音栈,GPT-Live 实现边说边听 — SIGKITTEN · 2026-08-04
- MiniMax H3 视频生成实测:4070 Super 做 10 秒片段要 546 秒 — anyup88 · 2026-08-04
- MiniMax H3 文生图实测:3090 Ti 跑 10 秒要 8 到 9 分钟 — iChrist · 2026-08-04
- 用户称 Opus 5 连一条动漫基础事实都答错 — yacineMTB · 2026-08-04
- Artificial Analysis 称中国最强模型仍落后美国 3–9 个月 — ArtificialAnlys · 2026-08-04