V4-Flash 重心转向智能体,牺牲了部分推理极限
teortaxesTex · x · 2026-08-01
评论指出 V4-Flash 模型在 CritPt 基准上的表现虽然与 Grok 4.5 等模型相当,但略逊于 GLM 5.2 等竞品。作者认为这并非模型的能力上限,而是研发团队此次放弃了专攻 STEM 领域的策略,将优化重心转向了智能体能力。
「模型」频道最新
- DeepSeek 发布 V4 测试版,AI 大模型价格战全面打响 — GaryMarcus · 2026-08-01
- 困扰学者两年的数学猜想,AI 数分钟写出严谨证明 — abeirami · 2026-08-01
- DeepSeek 疑似 V4-Flash 模型测试端点曝光 — victormustar · 2026-08-01
- 马斯克官宣 Grok 4.5:跑分超 GPT-5.6 并推出终端编程智能体 — elonmusk · 2026-08-01
- Kimi K3推理加速升级:百万上下文性能不再衰减,下载量破14万 — BanghuaZ · 2026-08-01
- 开源模型逼宫?网友调侃某厂商因DeepSeek被迫降价80% — InternationalGap3698 · 2026-08-01