博主自建盲测:pplx-decider-1.1 与前沿模型一致率达 95.6%

bo_wangbo · x · 2026-10-07

作者 bowangbo 关注 pplx-decider-1.1 在基准之外的实际表现,自建了一个对比实验:用 Critic(Ops 5.5)跨 4 个领域生成 1000 个问题及选项,让 Astra 6.1 作为前沿模型作答,再对比各家与前沿答案的一致率。结果 jev113 一致率 92.8%,作者的模型达 95.6%,额外敏感性检查显示结果非常稳定。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →