WeirdML v2 评测发布:任务扩至 19 项,成本与性能呈明显正相关
yacineMTB · x · 2026-08-07
WeirdML v2 评测基准正式发布,带来了显著扩展与升级:
- 任务量大增:测试任务从原来的 6 项扩展至 19 项。
- 追踪 API 成本:新增了对 API 调用成本及其他元数据的追踪,以便更深入地洞察不同模型间的差异。
- 成本与性能关系:成本 vs 性能的图表显示出明显的正相关趋势(即更高成本的模型通常带来更好的结果)。
- 帕累托前沿分散:呈现出非常多样化的帕累托前沿,来自 6 家不同公司的 11 款模型在特定成本区间内达到了最高准确率(如 Grok 3 等)。
此外,推文也提及了 Muse Spark 1.2 (xhigh) 在该榜单上获得了 60.3% 的分数,表现不错但距离最前沿模型仍有差距。
「模型」频道最新
- 曝字节正训练 10T 规模推理模型,Seed 团队达 2000 人 — alexvoica · 2026-08-07
- 曝 Qwen 3.8-Max 下周发布:首推 2.4T 参数,27B 随后跟上 — Ok-Shower7286 · 2026-08-07
- 韩国 SK Telecom 发布 688B 参数开源大模型 A.X K2 — huggingface · 2026-08-07
- 英伟达高管:推理模型 Alpamayo 攻克自动驾驶长尾难题 — ZGojcic · 2026-08-07
- DeepSeek-V4-Flash在AMD MI325X上行为异常?用户报告工具调用混乱 — Brunofcsampaio · 2026-08-07
- 首发意第绪语大模型:高质量语料与多任务基准 — Yiddish-NLP · 2026-08-07