ICML获奖基准FutureSim:GPT-5.6可执行超1.5万次工具调用
scaling01 · x · 2026-08-04
近期获 ICML 预测研讨会最佳论文的 FutureSim 基准更新了评测结果。数据显示,GPT-5.6-Sol 在长周期任务中表现领先,能够在单次运行中执行超过 1.5 万次工具调用,并耗时一天以上完成任务。
此外,与 Fable-5 和 Claude 系列模型相比,GPT-5.6 展现出了显著的测试时适应能力(test-time adaptation),在初始准确率相近的情况下实现了更大幅度的性能提升。
「模型」频道最新
- 安全护栏频触与上下文丢失,开发者吐槽 Claude Opus 5 体验下滑 — eyishazyer · 2026-08-04
- 抛弃 Claude Code:将深度研究工作流迁移至开源模型实战 — TheZachMueller · 2026-08-04
- 实测对比:MMH3 多模态能力优于 Google Omni Flash — Ok-Act-9620 · 2026-08-04
- 长上下文模型仍会遗忘:开发者分享长对话管理实践 — Entire-Ship8618 · 2026-08-04
- Kimi K3 投机解码模型下载破 60 万,AMD MI355X 实测吞吐大增 — bookwormengr · 2026-08-04
- Kimi K3 推理模式需保留完整消息,多数人用错了 — NielsRogge · 2026-08-04