评测显示Web搜索大幅缩小模型间准确率差距

PolarBearby · x · 2026-09-01

Braintrust 评测了 1329 个时事问题,对比了 4 个模型在 14 种条件下的表现。关键发现:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →