神秘模型 DeepSWE 评测超 80%,远超 Fable 与 GPT-5.6-sol
kimmonismus · x · 2026-08-21
某神秘模型在 DeepSWE 的 10 项任务中取得了超过 80% 的成绩,显著优于 Fable (65%) 和 GPT-5.6-sol (52%)。博主推测这可能来自一家中国公司,或者是新版 GLM 或 Kimi 模型。
「模型」频道最新
- DeepSeek 推出 V4-vision-exp:极速且低成本 — teortaxesTex · 2026-08-21
- DeepSeek V4 视觉模型上线,主打极速与低价 — teortaxesTex · 2026-08-21
- DeepSeek 发布 V4-Flash-Vision-Exp,多模态 Agent 能力逼近 Opus 4.8 — deepseek_ai · 2026-08-21
- 唐杰谈 scaling 演进:FLOPs 是智能,参数是知识 — cedric_chee · 2026-08-21
- MIMO V3 基准测试曝光,Pro 版接近 Fable 水平 — teortaxesTex · 2026-08-21
- 曝 GLM-5.4 借助 RL 快速进化,实测超越 GPT — kimmonismus · 2026-08-21