人类数据瓶颈在「品味」:好标注专家定价权飙升,合成数据反增需求
joecole · x · 2026-09-25
作者观点:人类训练数据的真正瓶颈在于优秀的 SPL(subject-matter 专家型标注者)。好的 SPL 经过长期的「品味训练」,直觉上知道哪些 token 有用、哪些是垃圾,这种经验只能靠项目积累,无法速成,因此拥有极强的定价权——一个好 SPL 能撬动实验室数倍的采买预算。
未培养 SPL 的数据公司陷入停滞,而持续投入培训的公司增长强劲。作者还预测:即使合成数据取代人类数据,也会因杰文斯悖论反而推高对 SPL 的需求。「有用的 token 鉴别者」这一市场仍处早期。
「Infra」频道最新
- TileRT×AMD 在 8×MI355X 上跑 GLM-5.3 达 469 tok/s,比 GB300 FP4 快 40% — vllm_project · 2026-09-25
- 转述:AI 在 TPU 设计某些方面已强过任何人,但只被当工具看 — burny_tech · 2026-09-25
- 低成本 4 卡推理再添招:x8 转接卡拆 4 个 x4,m.2 也能转 PCIe — TheZachMueller · 2026-09-25
- 网友用双 RTX 5090 以 vLLM 本地部署 27B 模型 — piddlefaffle12 · 2026-09-25
- CLion 2026.2.3 支持 NVIDIA CUDA Tile C++ 语法 — blelbach · 2026-09-25
- AMD 边缘计算新招:单台工厂盒子工作负载达 Jetson 级 2.3 倍 — shashib · 2026-09-25