让两个 LLM 持剑对砍再盲投票:物理剑斗竞技场公开 Elo 数据
Time-Shelter-35 · reddit · 2026-08-29
独立开发者开源了 STICKBLADE ARENA:两个模型各操控一个火柴人,在 pymunk 真实 2D 物理引擎(动量、布娃娃、武器碰撞)里实时对战。每回合模型读取世界状态 JSON(双方 HP、位置、武器攻击范围、冷却),返回动作 JSON——无预设脚本,全靠模型自己推理走位与出剑时机。
评测设计亮点:
- 人类评审盲看回放(双方匿名标 A/B)投票谁打得更聪明,投票后才揭晓身份并更新 Elo
- Elo 按 6 个轴分别计分:(模型, 高风险区, 武器, 模式, 场地, 蒙眼),同一模型用弓蒙眼与用剑正常模式的评分不同
- 双榜并行:感知榜(人类投票→Elo)与客观榜(胜负/伤害/命中率)
- 设 4 个非 LLM 基线 bot(随机/无脑攻击/拉距离/脚本 pro),检验模型是否真比「永远挥剑」强
阵容与早期发现:
- 24 名选手:OpenRouter 免费档 10 个(gpt-oss 系列、gemma-4、kimi-k2 等)、Groq 6 个、付费 gpt-4o-mini
- 弓箭局基本由「会等冷却」的模型赢,多数模型第一回合就打空弹匣
- 蒙眼模式(只靠声音线索)会让头部模型优势大幅缩水
- deepseek-r1-distill-70b 约 15% 回合超时,Elo 被时钟判负而非战术拖垮
- 脚本 bot:pro 目前在客观榜上打赢 3 个免费档 LLM
所有对局可经 /api/export 导出 JSON/JSONL,源码在 GitHub,线上站点免登录即可投票,单场 1-3 分钟。作者做这个的初衷是受够了「让另一个 LLM 当裁判」的推理评测榜。
「编程与Agent」频道最新
- Hermes Agent 隐藏技巧:/btw 启动后台任务 — Teknium · 2026-08-29
- 美政府聚焦智能体 AI 与量子技术融合 — ChuckDBrooks · 2026-08-29
- Google WikiSkill 赋予 Agent 持久记忆,小模型也能越级打怪 — The Decoder · 2026-08-29
- 让 Claude 自主跑程序化 SEO:中国第一饼图生成器诞生 — doooyle · 2026-08-29
- ARK 运行时监督层拦截 LangGraph Agent 工具调用 — Aromatic-Ad-6711 · 2026-08-29
- 求助:Claude Desktop 接 OmniRoute 导致工具调用失败 — Glittering_Zombie_60 · 2026-08-29