TypeSafe AI 的 RLCD 路线引发讨论:创新还是换壳

TypeSafe AI 的 Jev 模型及其 RLCD(替代 RLHF 的后训练方法)成为讨论焦点。支持者认为 2022 年 AI 从 token 预测转向指令跟随是关键转折,但 RLHF 作为规模化路径存在局限,RLCD 提供了另一条路;质疑者则表示除 JSON 输出和置信度分数外看不出实质创新,对其热度存疑,双方围绕 RLCD 到底新在哪展开争论。

2026-09-18 ~ 2026-09-19 · 2 条相关