ICML获奖基准FutureSim:GPT-5.6可执行超1.5万次工具调用

scaling01 · x · 2026-08-04

近期获 ICML 预测研讨会最佳论文的 FutureSim 基准更新了评测结果。数据显示,GPT-5.6-Sol 在长周期任务中表现领先,能够在单次运行中执行超过 1.5 万次工具调用,并耗时一天以上完成任务。

此外,与 Fable-5 和 Claude 系列模型相比,GPT-5.6 展现出了显著的测试时适应能力(test-time adaptation),在初始准确率相近的情况下实现了更大幅度的性能提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →