用 RL 训练 4B 小模型制霸 GeoGuessr,全套代码将开源

ariG23498 · x · 2026-09-02

开发者 adithyask 预告:仅用强化学习微调一个 4B 参数的视觉语言模型(VLM),就能在地理猜图游戏 GeoGuessr 上达到顶尖水平。

项目承诺开源全套组件:代码、RL 训练环境、数据集、训练配置和评测,端到端可复现,「即将放出」。ariG23498 转发并调侃称世界顶尖 GeoGuessr 玩家 georainbolt「你的时代结束了」。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →