Qwen 和 DeepSeek 竟在基准测试中使用 Claude Code

goddamnit_1 · reddit · 2026-08-18

用户发现 Qwen 2.5 和 DeepSeek 等开源模型在部分基准测试中使用了 Claude Code 作为评测框架,而非各自自有的或开源的 Harness。作者质疑这种做法是否仅仅是因为 Claude Code 能带来更好的性能分数,并询问社区在实际使用中的体验差异。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →