开发者呼吁 OpenAI 独立评估应建成市场而非少数机构小组
arthurcolle · x · 2026-09-14
开发者 arthurcolle 在回复 Sam Altman 时提出:当前最需要评估的不只是模型本身,而是围绕模型的 harness 与 agent 生态,尤其在不同领域的 AGI 用例中——少数几家机构覆盖不了这么大的面,市场可以。
他针对 OpenAI 的 Independent Evaluators 计划指出,目前参与的只有 METR、Redwood 等少数机构,「那是一个小组,不是一个生态」。他主张独立评估应成为训练管线之上真正的市场:机构可以针对具体行业垂直领域构建、购买和出售 evals,同时需要强大且健壮的开源 evals 社区。
所属事件:METR 扩权引热议,业界呼吁多元独立 AI 评估生态(38 条相关)→
「漫话AGI」频道最新
- 回顾三年前 AI 播客预测:时间线大多兑现,旧模型惨不忍睹 — misovalko · 2026-09-14
- 前 Anthropic 员工 Jacob Coxon 辞职,称造 AI 如「召唤外星物种」 — AlexTensor · 2026-09-14
- 从业者:AI 舆论与 Agent 实际落地差距巨大,一切仍处早期 — annbordetsky · 2026-09-14
- 攻击者窃取 METR API 密钥烧掉约 60 万美元额度,潜伏三周 — beffjezos · 2026-09-14
- Perry Metzger 断言:历史已证明 LLM 开放发布派胜过末日论者 — bradneuberg · 2026-09-14
- AI 擅长数学与编程却不通人文?反驳者:别把可评测的表面当学科全部 — _onionesque · 2026-09-14