Claude 与 Gemini 语义通过率均达 98.67%,失败机制却不同
Plastic-Cell-4497 · reddit · 2026-08-28
作者发布了首个基于冻结 CFC 的基准测试,对 Claude 和 Gemini 进行了 600 次主要运行对比。
- 结果:两模型均达到 98.67% 的语义通过率。
- 差异:尽管高分接近,但两者在失败案例和失败机制上存在显著差异。
- 目的:旨在研究这些罕见的失败模式,为 AI 可靠性、评估和安全性提供参考。
「模型」频道最新
- Qwen 模型 TurboQuant KV Cache 导致多轮对话失效 — QuixiAI · 2026-08-29
- 2026 硬件适配:从 8GB 到 384GB 选型指南 — BLUECOW009 · 2026-08-29
- Opus 5 疑似存在知识盲区,可通过清空缓存重试 — legit_api · 2026-08-29
- GLM 5.3 开源权重亮相,DFlash 2 投机解码吞吐达 FP8 的 4.4 倍 — gan_chuang · 2026-08-29
- 国产模型“寒武纪大爆发”?网友热议背后推手 — vista8 · 2026-08-29
- 本地推理工具 ds4 新增分支,支持 GLM 5.3 Flash — lakySK · 2026-08-28