Nat Lambert 出任 Mercor 顾问:RL 数据质量太低,评测科学是前沿
natolambert · x · 2026-10-11
AI 研究者 Nathan Lambert(引用 Mercor 招聘团队推文)阐述其观点:近年数据产业爆发,但净产出质量仍太低,放大了 reward hacking 等行为。他正在为 Mercor 顾问一个研究方向:构建可扩展的样本高效 RL 数据方法,并推动评测科学前沿、围绕明确经济价值领域建 benchmark 做优化。他预测前沿实验室将围绕「开放推理、开放后训练、数据」进行重大投入,核心能力是构建真实世界代表性的评测与合成数据方法。
「研究」频道最新
- 多伦多医院训练 AI 术中导航,实时标出安全切口区域 — EricTopol · 2026-10-11
- OpenAI 数论成果解读:虚二次域椭圆曲线模性突破,Hodge 论文因符号错误撤稿 — lpachter · 2026-10-11
- SpIDER 论文:让编码 agent 先找对代码位置再动手修改 — mangahomanga · 2026-10-11
- CMU 教授用 Astra 以 27KB 代码生成精细 3D 龙 — 141_1337 · 2026-10-11
- Claude 挖掘公开望远镜数据,发现158光年外三颗新行星 — DavidmComfort · 2026-10-11
- 扩散 LM 最佳论文作者辍学斯坦福加入 OpenAI,访谈谈 AR vs 扩散 — aaron_lou · 2026-10-11