基准测试在比开源原始推理与闭源封装产品
Stir_123 · reddit · 2026-07-06
作者指出基准测试其实是在拿开源模型的原始推理,去对比闭源厂商的封装产品:闭源 API 背后可能跑自有文档 RAG、按查询注入隐藏系统提示、路由到专家模型、做提示预处理、在生成前调用内部工具,而 Anthropic 等还隐藏推理链。这就像把发动机上测功机的结果,和一辆带牵引力控制、车道保持的整车路测结果相比。因此闭源前沿模型与 GLM-5.2 等开源模型的真实模型质量差距,可能远小于基准所示——溢价买的或许是外围工具与脚手架,而非原始模型能力。
「模型」频道最新
- 6TB Fable 数据遭倒卖:内含小米华为等企业泄露密钥 — teortaxesTex · 2026-09-11
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11