用 RL 训练 4B 小模型制霸 GeoGuessr,全套代码将开源
ariG23498 · x · 2026-09-02
开发者 adithyask 预告:仅用强化学习微调一个 4B 参数的视觉语言模型(VLM),就能在地理猜图游戏 GeoGuessr 上达到顶尖水平。
项目承诺开源全套组件:代码、RL 训练环境、数据集、训练配置和评测,端到端可复现,「即将放出」。ariG23498 转发并调侃称世界顶尖 GeoGuessr 玩家 georainbolt「你的时代结束了」。
「Fun」频道最新
- 经历过丧子之痛的父亲:女儿出生后一周我时刻担心她会离开 — justalexoki · 2026-09-02
- 「John Wickachu」:AI 混搭视频把约翰·威克变成宝可梦训练师 — Brave-Wishbone-3650 · 2026-09-02
- GPT-6 会先于 GTA6 发布吗?网友调侃 AI 迭代速度 — hyhieu226 · 2026-09-02
- 乘客挤满登机梯:一个字面意义的「对齐问题」 — misovalko · 2026-09-02
- 开发者在终端造“黑洞”,久坐不休息代码就被引力透镜扭曲 — petewoodbridge · 2026-09-02
- AI 圈流行定义「slop 因子 = 材料 / 意义」 — jordiponsdotme · 2026-09-02