基准测试在比开源原始推理与闭源封装产品
Stir_123 · reddit · 2026-07-06
作者指出基准测试其实是在拿开源模型的原始推理,去对比闭源厂商的封装产品:闭源 API 背后可能跑自有文档 RAG、按查询注入隐藏系统提示、路由到专家模型、做提示预处理、在生成前调用内部工具,而 Anthropic 等还隐藏推理链。这就像把发动机上测功机的结果,和一辆带牵引力控制、车道保持的整车路测结果相比。因此闭源前沿模型与 GLM-5.2 等开源模型的真实模型质量差距,可能远小于基准所示——溢价买的或许是外围工具与脚手架,而非原始模型能力。
「模型」频道最新
- Claude Opus 5 被评价为强子代理,但高层创意仍偏僵硬 — iskander · 2026-07-27
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- 欧洲 ChatGPT Plus 用户开始看到“Extra High”质量选项 — PressPlayPlease7 · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27