质疑 RLCD 的 RL 是否必要:输出可微为何还要强化学习

Relative_Wallaby_823 · reddit · 2026-09-19

有用户针对 RLCD(jev)的 YouTube 演示提出技术质疑:如果模型只输出 Choice、Score、Noul 这类结果,它们本身完全可微(交叉熵或 MSE 即可训练),那么引入 RL 是否只是营销噱头?作者追问 RL 环境究竟长什么样。这是一个关于 RL 在特定架构中是否必要性的技术讨论。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →