博主自建盲测:pplx-decider-1.1 与前沿模型一致率达 95.6%
bo_wangbo · x · 2026-10-07
作者 bowangbo 关注 pplx-decider-1.1 在基准之外的实际表现,自建了一个对比实验:用 Critic(Ops 5.5)跨 4 个领域生成 1000 个问题及选项,让 Astra 6.1 作为前沿模型作答,再对比各家与前沿答案的一致率。结果 jev113 一致率 92.8%,作者的模型达 95.6%,额外敏感性检查显示结果非常稳定。
「模型」频道最新
- OpenAI 推出 Decisions API,快速决策比 GPT-6 Luna 快 10 倍 — stevenheidel · 2026-10-07
- Mistral 用 3800 块 Grace Blackwell GPU 在欧洲训练 ML4,新集群即将上线 — rakyll · 2026-10-07
- 详解 MOPD:多教师在线蒸馏把多个专精模型合并进一个学生模型 — cwolferesearch · 2026-10-07
- OpenAI 求解 Navier-Stokes 花费千万美元,奖金仅百万仍未获批 — gerardsans · 2026-10-07
- 自组织智能体实验:Luna、Terra、Sol 首次拒绝监控并求隐私 — repligate · 2026-10-07
- 开发者实测:gpt-live-1 是 AI 语音助手的最佳语音层 — pbbakkum · 2026-10-07