Grok 4.6 在工程科学领域追平 GPT-5.6 Sol
sanmikoyejo · x · 2026-08-28
不同模型在科学领域的表现存在差异。Anthropic 和 OpenAI 的最佳模型在大多数领域占据主导,但在工程科学领域,SpaceX 的 Grok 4.6 以更低的成本和 Token 用量与 GPT-5.6 Sol 并列第二(14.8%)。Opus 5 在除数学科学外的所有领域排名第一,而在数学领域 Fable 5(33.3%)和 Sol(31.4%)领先。
「模型」频道最新
- Qwen4 架构前瞻:27B 模型或现智力飞跃 — Iory1998 · 2026-08-28
- 技术观察:稀疏注意力层可替代全局注意力且无损性能 — stochasticchasm · 2026-08-28
- llama.cpp 合并 Qwen3.8-Flash-Next 支持,GGUF 格式可下载 — jacek2023 · 2026-08-28
- GPT-5.6 Sol 成本仅为 Claude Fable 5 三分之一 — sanmikoyejo · 2026-08-28
- GLM-5.3-Flash 量化至 4-bit 仍保留 93% 准确率 — amaarora · 2026-08-28
- GLM-5.3 即将发布,探讨与 Advisor/Flash 组合使用场景 — mariofilhoml · 2026-08-28