泄露任务揭示 Anthropic 训练机制:用人类轨迹训练裁判模型
burny_tech · x · 2026-07-30
开发者基于近期泄露的 Anthropic 标注任务推测,Anthropic 可能正通过人类标注轨迹训练专门的「裁判模型」,并利用该模型在推理时动态生成评分标准(rubrics)来评估智能体表现。
这一机制与近期 Kimi K3 在非可验证任务上的强化学习(RL)策略高度相似。Kimi 采用的是让大模型作为裁判,实时生成评估细则并对候选输出打分。讨论认为,这种基于生成式奖励模型(GRM)的方法正成为行业提升模型能力的通用路径。
「模型」频道最新
- 腾讯混元 Hy3 模型解决 50 年未解组合数学难题 — Tim_Dettmers · 2026-07-30
- 微软MAI-Code-1-Flash实测:兼顾编程质量与Token效率 — lee_stott · 2026-07-30
- Sarvam AI 发布印度本土基础设施上的开源模型 — AashaySachdeva · 2026-07-30
- 实测 OpenRouter 全线 TTS:Kokoro-82M 长文本最佳且最便宜 — nathanborror · 2026-07-30
- Qwen3.6 MoE 2-bit 量化版登顶 Hugging Face 趋势榜 — EschaLabs · 2026-07-30
- 用户盛赞 Grok 4.5:生成速度极快,一旦习惯便无法回头 — XFreeze · 2026-07-30