深度评测:Grok 4.5、Kimi K3等四大模型真实表现与争议
eyishazyer · x · 2026-07-30
作者对近期备受关注的四款 AI 编程模型进行了总结评价,指出它们都只兑现了部分预期:
- GPT-5.6 Sol:评价两极分化,有人认为其一次性生成 Web 应用的能力远超以往,但也有人遭遇极长的思考延迟。
- Kimi K3:r/LocalLLaMA 社区认为其证明了中国模型正在快速缩小差距。亮点在于它不会像 Codex 那样轻易拒绝基础的网络安全或底层编程任务,但 2.8 万亿参数的体量导致几乎没人能在本地运行。
- Grok 4.5:xAI 首次与 Cursor 联合训练,使用了真实的开发者会话数据。Cursor 甚至坦诚其基准测试的优势可能部分源于旧代码库快照泄露到了训练集中。
「编程与Agent」频道最新
- Bob Martin:不要为 AI 智能体预设庞大架构 — mariofilhoml · 2026-07-30
- 防 Codex 滥跑测试,开发者推 guardrails 工具 — kevinkern · 2026-07-30
- 免费课程:如何优化LLM分类成本,保持性能不降 — HamelHusain · 2026-07-30
- 生产环境AI模型静默降级?用金丝雀测试检测模型漂移 — Ok-Independent3290 · 2026-07-30
- 企业级 AI 系统设计:最大化可靠性而非盲目堆砌智能 — iamKierraD · 2026-07-30
- 把画海雀梗变成真基准:用 TRL 与 HF 训练模型 — SergioPaniego · 2026-07-30