LlamaIndex 创始人对话 Snorkel AI:RL 环境的「公平性」难题
ajratner · x · 2026-09-30
LlamaIndex 创始人 Jerry Liu 主办了一场关于 evals 与 RL 环境的晚宴讨论,与 Snorkel AI 的 Vincent Chen 等人交流。核心背景:数据和 RL 环境公司(如 Snorkel)近年增长迅猛,evals 热度爆炸,但模型每次发布都在刷穿基准。
讨论要点:
- 构建 RL 环境的一大挑战是「公平性」:模型在某环境失败时,如何归因于输入、harness 还是奖励模型?
- 构建合适的奖励非常困难。
- 核心主题:数据必须被「开发」才有用——用户/企业手握大量有价值的原始数据(病历、历史图像/文档),但要让它们可用于评估和训练,需要一种新的工程与研究范式,需要设计新接口和编程模型,让领域专家参与,使数据和环境足够难、足够公平、足够复杂。
- 还讨论了哪些 evals 尚未解决、什么留给前沿模型、什么属于你自己拥有的智能。
「编程与Agent」频道最新
- OpenAI 推 Codex「Ultrafast」提速 8 倍,开发者吐槽:没人付得起 — jarrodwatts · 2026-09-30
- Open Dots 开源替代 OpenAI Dots:4.3k star 的自托管 AI 工作台 — matchaman11 · 2026-09-30
- ChatGPT 订阅可直接用于 Devin、Notion 等 16+ 合作产品 — charliermarsh · 2026-09-30
- Armin Ronacher:Pi 终端默认主题跟随你的终端配色 — mitsuhiko · 2026-09-30
- 印度团队用 agent 把 Instagram 招工 Reel 转成结构化招聘帖 — Such-Pear-588 · 2026-09-30
- 创作者策略 Agent:从问题识别到产品构想 — pranay_naragoni · 2026-09-30