解决 LLM 评审过载:分片监督让弱模型胜过强模型

aran_nayebi · x · 2026-08-14

随着 AI 产出超越人类审查能力,使用模型审查模型(可扩展监督)变得至关重要。作者指出当前存在一个关键瓶颈:在决策负荷过重时,单个模型即使增加计算量也无法可靠地同时检查多项要求。

论文提出了名为 Sharding(分片) 的策略:将评估标准划分为较小的组,分配给独立的调用进行评估,最后聚合结论。

核心实验与结论:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →