AutomationBench:GPT-5.5与Claude Opus 4.8工作风格对比

ArtificialAnlys · x · 2026-07-07

在AutomationBench上各模型工作风格差异显著。GPT-5.5(xhigh)偏向密集操作,平均每个任务调用49次工具、跨25轮;Claude Opus 4.8(max)更审慎,35次工具调用集中在14轮内,护栏违规更少(每任务0.55 vs 0.66)。

Grok 4.3(high)轮次最少(13轮),但因过早声明任务完成而非高效完成,表现不如坚持到底的模型。

所属事件:AutomationBench-AA发布:AI自动化测评(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →