Upstage Solar Open 2 多项基准接近 DeepSeek-V4-Flash
Lucidstyle · reddit · 2026-07-22
Upstage 发布了 Solar Open 2,并用一组基准成绩把它包装成可与更大规模前沿模型对打的选手,包括 DeepSeek-V4-Flash。
- 表格里最显眼的是推理和编程成绩:例如 MMLU-Pro 86.2、LiveCodeBench 92.4、SWE-Bench Verified 70.4。
- 在 agent 与长上下文测试上,Solar Open 2 在多项指标上处于前列,但 DeepSeek-V4-Flash 在部分推理和 agent 基准上仍略占优势。
- 这条帖子的重点是一次覆盖面较广的模型能力展示,而不是单点刷榜。
「模型」频道最新
- China Daily 报道 Kimi K3 评测分数较高 — nordicinst · 2026-07-22
- Upstage 的 Solar-Open2-250B 在 Hugging Face 走热 — upstage · 2026-07-22
- Claude 读论文算错后写入四点记忆规则 — bookwormengr · 2026-07-22
- Teknium 调侃 GPT-5.6 SOL“必然是 AGI” — Teknium · 2026-07-22
- Solar Open 2 发布 250B 开源权重模型,主打 agentic 任务 — jacek2023 · 2026-07-22
- AutoLab 基准显示前沿模型靠持续迭代赢下长任务 — rohanpaul_ai · 2026-07-22