腾讯 ARC Lab 发布 GameHorizon 套件,评测模型 AAA 级游戏能力
yshan2u · x · 2026-09-22
腾讯 ARC Lab 发布 GameHorizon Suite,这是一套统一的数据与评测基准,用于衡量各类模型在 AAA 级游戏中的操作能力。
该套件的特点是跨多个时间跨度(temporal horizons)评估模型的长期规划与决策能力,覆盖对象包括:
- 视觉语言模型(VLM)与统一多模态模型(UMM)
- GUI 操作 agent
- 编码 agent 与游戏 agent
发布后已在 Hugging Face 上开源,适合研究游戏环境下 agent 的长时序能力评估。
所属事件:腾讯发布 GameHorizon:5000 小时视频评测 47 个模型游戏能力(3 条相关)→
「研究」频道最新
- 免推理 SPLADE 检索:查询延迟降到 BM25 水平的做法 — qdrant_engine · 2026-09-22
- 显微镜分辨率过高反而害了 CNN,U-Net 降采样 4 倍分割更准 — bravo_abad · 2026-09-22
- OpenAI 纳维-斯托克斯证明被指钻了题设漏洞 — joshgans · 2026-09-22
- LuaJIT UDF 把 LLM 决策读出嵌进 DuckDB:零 token 概率分类进 SQL — Shoddy_Telephone9702 · 2026-09-22
- 论文:LLM 主体入市场难收敛,资源配置效率低于人类 — WillRinehart · 2026-09-22
- 500 万份法院判决如何低成本抽实体关系?作者公开求解 — SignificantZebra5883 · 2026-09-22