Grok 4.6 评测分析:法律与经济指标领先,编程未占优
ChrisGPT · x · 2026-08-20
Grok 4.6 在人工智能分析指数中得分进入 60 分段。有趣的是,其优势并非体现在编程基准测试上,而是在法律和 GDP 估值相关基准中表现突出。
「模型」频道最新
- Claude 准确预测 Qwen 3.8 27B 性能与基准分数 — OneMoreName1 · 2026-08-21
- GLM 5.3 SlopCodeBench 评测:严格通过率 47% — corruptbytes · 2026-08-21
- 研究称大模型后期训练导致语言新颖但缺乏实用性 — TuhinChakr · 2026-08-20
- Grok 4.6 实测口碑:用户称已 100% 接管 Codex 的编码工作 — CedricMakes · 2026-08-20
- 国内大厂客户端系统提示词泄露:三层记忆与 MCP 路由 — vista8 · 2026-08-20
- 测试发现 Base 模型补全内容可继承提示词的 AI/人写特征 — AaronBergman18 · 2026-08-20