Qwen 和 DeepSeek 竟在基准测试中使用 Claude Code
goddamnit_1 · reddit · 2026-08-18
用户发现 Qwen 2.5 和 DeepSeek 等开源模型在部分基准测试中使用了 Claude Code 作为评测框架,而非各自自有的或开源的 Harness。作者质疑这种做法是否仅仅是因为 Claude Code 能带来更好的性能分数,并询问社区在实际使用中的体验差异。
「模型」频道最新
- 用户实测 GPT Luna:聪明又好聊,「没想到这么强」 — oyacaro · 2026-08-18
- Upstage Solar Pro 4 在 Nous Portal 免费开放一周 — NousResearch · 2026-08-18
- Hermes 模型表现稳定 — NERDDISCO · 2026-08-18
- CPU 运行 AI Agent:Gemma 4 26B 还是 Qwen 3.6 35B? — Kahvana · 2026-08-18
- Qwen3.8-27B 模型评测与 SGLang 高速部署实战 — Sam Witteveen · 2026-08-18
- Qwen、GPT、Grok 同台竞技 Three.js 香水站开发 — Acceptable-Object390 · 2026-08-18