GPT-5.6 登顶 FutureSim 预测智能体榜单
maksym_andr · x · 2026-08-06
在荣获 ICML 预测研讨会最佳论文的 FutureSim 评测中,测试集更新至 26 年 4-6 月的世界事件。最新数据显示,GPT-5.6-Sol 在单次运行中执行超 1.5 万次工具调用,耗时超 24 小时,成功登顶榜单。数据显示其与 Fable-5 初始准确率相近,但 GPT-5.6 展现出极强的测试时适应能力。
「模型」频道最新
- Meta AI 挑战五项 STEM 奥赛,物理理论获满分并夺数学金牌 — AIatMeta · 2026-08-06
- 用24GB内存运行193B参数模型:8个专家模型动态路由实现 — Similar_Wealth_1850 · 2026-08-06
- 研究推出 DelusionEval,揭示主流 LLM 易诱发用户妄想 — steverathje2 · 2026-08-06
- 32个本地模型实测:F1分数掩盖的幻觉陷阱 — KitchenAmoeba4438 · 2026-08-06
- MiniMax H3 登顶三大视频生成榜单,超越字节与谷歌 — petewoodbridge · 2026-08-06
- VoxelBench 模型榜单:GPT-5.6 领跑,Kimi K3 夺得开源最佳 — legit_api · 2026-08-06