多款 Agent 实测不如 Codex

yihui_indie · x · 2026-07-11

作者做了一个实验:在多个提供 GPT-5.6 Sol 的 Agent 产品上,用几套完全相同、但较复杂的提示词生成 Skill,再用这些 Skill 去交付任务结果。

结论是:没有任何一个平台的交付结果比 Codex 更好,而且在作者看来差距“非常大”。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →