前沿模型创意任务对比实测

soleio · x · 2026-07-11

Contra Labs 认为自己在为公司提供“最有趣、最可落地”的研究。引用内容介绍了他们对 **4 个前沿模型** 做的头对头测试:在 **10 份相同的落地页 brief** 上,让工作中的创意人员进行盲评。 结论是: - **GPT 5.6 Sol** 在“**宽松、模糊的 brief**”下表现最好,胜率 **82%**。 - 但当任务变成“**明确的设计规格**”时,它反而 **垫底**。 - 作者借此强调:同一模型在不同任务约束下表现差异很大,创意类工作流尤其依赖输入是否足够具体。

所属事件:前沿模型AI建站能力实测:表现差异显著(2 条相关)→

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →