人类数据瓶颈在「品味」:好标注专家定价权飙升,合成数据反增需求

joecole · x · 2026-09-25

作者观点:人类训练数据的真正瓶颈在于优秀的 SPL(subject-matter 专家型标注者)。好的 SPL 经过长期的「品味训练」,直觉上知道哪些 token 有用、哪些是垃圾,这种经验只能靠项目积累,无法速成,因此拥有极强的定价权——一个好 SPL 能撬动实验室数倍的采买预算。

未培养 SPL 的数据公司陷入停滞,而持续投入培训的公司增长强劲。作者还预测:即使合成数据取代人类数据,也会因杰文斯悖论反而推高对 SPL 的需求。「有用的 token 鉴别者」这一市场仍处早期。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →