泄露任务揭示 Anthropic 训练机制:用人类轨迹训练裁判模型

burny_tech · x · 2026-07-30

开发者基于近期泄露的 Anthropic 标注任务推测,Anthropic 可能正通过人类标注轨迹训练专门的「裁判模型」,并利用该模型在推理时动态生成评分标准(rubrics)来评估智能体表现。

这一机制与近期 Kimi K3 在非可验证任务上的强化学习(RL)策略高度相似。Kimi 采用的是让大模型作为裁判,实时生成评估细则并对候选输出打分。讨论认为,这种基于生成式奖励模型(GRM)的方法正成为行业提升模型能力的通用路径。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →