实测 DeepSeek v4 与 GLM 5.2 表现相当,评测框架成关键
Sentdex · x · 2026-08-08
开发者使用 OMP harness 对 DeepSeek v4(0731版本)进行了实测,发现其表现非常出色,在相同测试框架下能力基本可与 GLM 5.2 互换。测试覆盖了个人实际工作流以及 Terminal Bench v2.1 基准。作者指出,拥有一个好的评测框架可能才是准确衡量模型能力的关键。
「模型」频道最新
- Sam Altman 谈 ChatGPT 审查制度,发问谁将首发无审查 AI — borowcy · 2026-08-08
- Gemma 模型下载量即将突破 10 亿次大关 — osanseviero · 2026-08-08
- OpenAI 迅速修复模型性格,被质疑故意压抑旧版个性 — Angaisb_ · 2026-08-08
- 数学视角拆解 Kimi K3:为何弃用 RoPE 位置编码 — nrehiew_ · 2026-08-08
- Affine 提出「推理蒸馏」新机制:用竞争驱动小模型进化 — bittingthembits · 2026-08-08
- GPT-5.6 Pro 复现伽罗瓦群计算,从第一性原理推导 — PMinervini · 2026-08-08