开源 4B VLM 用 RL 练 GeoGuessr,单卡 A100 跑赢 GPT 与 Haiku

SergioPaniego · x · 2026-09-09

adithyask 团队用强化学习训练了一个 4B 参数的视觉语言模型来玩 GeoGuessr(看图定位游戏),SergioPaniego 以 "GTA 6 之前先等到了 GeoGuessr RL 环境" 转发扩散。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →