2008 年首个通用 RLHF 算法 TAMER 推出新版,可上手实验

PeterStone_TX · x · 2026-09-06

Peter Stone 指出,TAMER 是 2008 年提出的首个通用 RLHF(人类反馈强化学习)算法,比 RLHF 概念流行早了十余年。Brad Knox 现已发布新版实现,任何人都可以自己上手实验,体验这一「人类通过反馈训练 agent」思路的原始形态。

所属事件:2008 年首个通用 RLHF 算法 TAMER 发布新开源版本(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →