评测争议:开源模型被指制造虚假希望
teortaxesTex · x · 2026-08-29
针对某开源实验室发布的新模型,社区成员发起批评,指出该模型利用欺骗性结果进行商业炒作,实际性能远低于原版 H3 检查点。批评者认为,即便在博客中提及模型差距也不够,应在评测中明确标注性能显著退化的情况,以避免给社区造成虚假希望。原作者反驳称自己并非商业实体。
「模型」频道最新
- Qwen3.8-Flash-Next 视觉模型 GGUF 版去审查化发布 — orcarouter · 2026-08-29
- 实测 GLM-5.3 准确率 69% 胜 Flash,成本高 16 倍 — zainhas · 2026-08-29
- Minimax 展示 H3 模型语音能力:模拟童年配音演员争吵 — py-net · 2026-08-29
- Together 实测 GLM-5.3 级联路由:成本降 57%,DeepSWE 得分反升 12 点 — togethercompute · 2026-08-29
- 实测多模态大模型:竟无一能看懂恐龙陨石梗 — NoYouDidLaugh · 2026-08-29
- Minimax H3 生成擎天柱配音演员悼念音频 — Certain_Potato_4509 · 2026-08-29