实测:中美 AI 模型差距在生产中已无意义
Any-Ad7702 · reddit · 2026-08-29
作者分享其实测经验:今年主要使用 DeepSeek、Qwen、GLM 等中国模型,Claude 仅作为兜底。本周试用的 Hy3 模型(21B 激活参数)在编码和 API 集成任务上,表现接近 DeepSeek V3 和 Kimi K3。作者认为,鉴于 DeepSeek 在 OpenRouter 上的统治地位、Qwen 在 Arena-Hard 的领先,以及小模型如 Hy3 的强劲表现,OpenAI 和 Anthropic 的护城河在实际生产任务中已不明显。
「模型」频道最新
- rednote 发布开源多模态智能体模型,支持 512K 上下文 — aftahi_ai · 2026-08-29
- GLM-5.3 跑分超 Sol 与 Opus,登顶 Terminal-bench-4.0 — nijfranck · 2026-08-29
- 实测发现 DeepSeek 俄语流利度领先中系大模型 — teortaxesTex · 2026-08-29
- Qwen 模型不同思维级别的表现对比 — Tall_Abrocoma_3533 · 2026-08-29
- 通过技巧让 Claude 暴露隐藏思考 Token — Rare-Paint3719 · 2026-08-29
- 为何 GPT-5.x 模型在代码审查中优于 Claude — dejavucoder · 2026-08-29