基准测试在比开源原始推理与闭源封装产品

Stir_123 · reddit · 2026-07-06

作者指出基准测试其实是在拿开源模型的原始推理,去对比闭源厂商的封装产品:闭源 API 背后可能跑自有文档 RAG、按查询注入隐藏系统提示、路由到专家模型、做提示预处理、在生成前调用内部工具,而 Anthropic 等还隐藏推理链。这就像把发动机上测功机的结果,和一辆带牵引力控制、车道保持的整车路测结果相比。因此闭源前沿模型与 GLM-5.2 等开源模型的真实模型质量差距,可能远小于基准所示——溢价买的或许是外围工具与脚手架,而非原始模型能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →