AI 太空竞赛实测:GPT-5.6 得分 13% 创纪录,Kimi K3 仅 5.2%
scaling01 · x · 2026-07-31
ValsAI 在一场超过 1 万名观众观看的直播中,对 GPT-5.6 Sol 和开源模型 Kimi K3 进行了极限测试,要求它们在 5 天内尝试运行一个太空计划。
最终成绩显示,GPT-5.6 Sol 以 13.0% 的得分创下新纪录(SOTA),而 Kimi K3 得分为 5.2%。
「编程与Agent」频道最新
- Marble 获 YC 支持:用计算机视觉盘点库存,AI 自动排班订货 — ycombinator · 2026-07-31
- 单次提示连跑24小时,开发者用 Claude 打造开源 3D 小镇 — Dr_Singularity · 2026-07-31
- MCP可靠性增强实测:200次运行有害事件锐减 — FewScarcity6957 · 2026-07-31
- 一人开发者用 Grok 全程 vibe-code 3D 游戏 — Daniel_Farinax · 2026-07-31
- CodeGraph 1.0 修复符号链接越权漏洞,避免向 Agent 泄露配置密钥 — JeremyCMorgan · 2026-07-31
- Gradio 预告将支持长任务断线恢复 — Gradio · 2026-07-31