ErdosBench 上线:GLM-5.3 仅次于 GPT-5.6
ChrSzegedy · x · 2026-08-28
新发布的 ErdosBench 基准测试包含 226 个研究级开放问题(类似 Erdos 风格),旨在避免数据污染。在该榜单中,GLM-5.3 Flash 排名第二,仅次于 GPT-5.6 Sol xhigh。
「模型」频道最新
- Google 一周更新:Gemini 3.5 Transcribe 与 Omni 1.1 Flash 领衔 — GoogleAI · 2026-08-28
- MiniMax H3 被发现能读懂国际音标,带口音对白更精准 — afinalsin · 2026-08-28
- Ollama 上线智谱 GLM-5.3-Flash:18B 激活参数、1M 上下文 — ollama · 2026-08-28
- zai-org/GLM-5.3 仓库现身 Hugging Face,聊天模板已流出 — kimmonismus · 2026-08-28
- 用户吐槽大模型仍不主动:明显下一步也不去做 — iruletheworldmo · 2026-08-28
- 金融 MoE 模型 Ling-3.0-flash-Fin 免费一月,人审边界成焦点 — Designer_Mouse_6109 · 2026-08-28