模型排行因领域而异:Grok 4.6 领跑法律,GPT-6 Astra 横扫金融与代码
sophiamyang · x · 2026-09-23
sophiamyang 观察到模型排名随领域变化明显:
- Grok 4.6 领跑法律基准
- GPT-6 Astra 在金融、FrontierSWE、代码审查、SRE 四项领先
- Claude Opus 5 在更广泛的医疗与代码生成榜单居首
- GLM 5.3 在客户支持与代码审查上具竞争力
结论:没有全能冠军,按具体工作领域选模型更重要。
「模型」频道最新
- Claude Code v2.1.280+ 会话中途切换 effort 不再破坏 prompt cache — kimmonismus · 2026-09-23
- 吹 SVG 和 3D 渲染评测时,没人晒拒绝率和配额限制 — BLUECOW009 · 2026-09-23
- GPT-6 Astra 对决 Opus 5.5:知识工作碾压,硬核数学仍是 OpenAI 地盘 — johnseach · 2026-09-23
- Polymarket 开盘赌 Claude 6:年内发布概率 91%,明年 3 月仅 37% — Polymarket · 2026-09-23
- Opus 5.5 连续重度使用 5 小时仅耗周额度 4%,降价后用量宽松 — rudrank · 2026-09-23
- 单 prompt 出完整 3D 场景:GPT-6 Sol 极少推理就跑通,四模型横评 — rohanpaul_ai · 2026-09-23