RL 的边界:没有评分函数就没有信号,"学习"是被夸大的行业话术
gerardsans · x · 2026-09-28
gerardsans 长文讨论 RL 的适用边界,回应"AI 能否形成研究品味"之争:
- 自 RL 时代起就围绕 heuristics、policy、reward 三个词打转:问题定义清晰、反馈快、检验便宜的任务 RL 才有效;涉及品味、模糊性、未知领域则不行——"如果你能写出评分函数,就不需要 AI 了"。
- 不确定性更大不意味着"多试 RL",而是信号已经消失:没有信号就没有 policy,只能打磨 proxy 并称之为搜索,"魔法目标函数不是计划,是带梯度的同人小说"。
- AI 缺少认知闭环:它不会发现自己错了并重建地图,而人正是这样形成专业能力的。模型只是采样和插值,"学习"是行业从未兑现的又一个被夸大的词。
「漫话AGI」频道最新
- 研究员称模型超说服力已经到来,附演示引热议 — teortaxesTex · 2026-09-28
- 创始人视角谈求职:绕过筛选项招聘,用作品直接敲开创业公司大门 — hackgoofer · 2026-09-28
- 程序员自嘲:多年 C 语言技巧积累不及几个月 Claude 产出 — zack_overflow · 2026-09-28
- 神经科学家调侃可解释性:302 神经元都搞不懂,先别保证对齐 — joshua_saxe · 2026-09-28
- 美国创意行业四年流失超20万岗位,创衰退期外最差纪录 — korymath · 2026-09-28
- 湾区 AI 研究员吐槽:模型极聪明却被糟糕后训练废掉 — nabla_theta · 2026-09-28