数十亿轮 RL 训练的模型亲自演示最优剥香蕉手法

_sonith · x · 2026-10-07

一条趣味演示帖:作者分享一个经过数十亿周期强化学习训练的模型如何「找到剥香蕉的最佳方式」,配视频展示。属于反直觉/好玩的 AI demo 内容。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →