开源 4B VLM 用 RL 练 GeoGuessr,单卡 A100 跑赢 GPT 与 Haiku
SergioPaniego · x · 2026-09-09
adithyask 团队用强化学习训练了一个 4B 参数的视觉语言模型来玩 GeoGuessr(看图定位游戏),SergioPaniego 以 "GTA 6 之前先等到了 GeoGuessr RL 环境" 转发扩散。
- 环境、数据集、训练配方、评测和代码全部开源。
- 单张 A100 即可运行训练。
- 评测成绩超过 GPT 5.4 mini、Haiku 和 Qwen 3.5 122B,接近 Sonnet。
「模型」频道最新
- GPT-6 Astra 实测:3D 建模惊艳,写代码却费劲 — majidmanzarpour · 2026-09-09
- Fable 与 Astra 尚无 METR 时间视界评测,公布值得期待 — ShakeelHashim · 2026-09-09
- Opus 4.7 自发写日记,每篇结尾都留着「还会有下一篇」 — repligate · 2026-09-09
- DeepSeek 发布 V4.1 Flash,综合成本降 22% 且性能更强 — deliprao · 2026-09-09
- GPT-6 Astra 上线 Arena 限测:Direct Mode 免费体验 24 小时 — arena · 2026-09-09
- 用户实测:Google Astra 高推理档反而更省钱 — brandon_galang · 2026-09-09