实测四大前沿模型:DeepSeek靠极低推理成本逆袭复杂Agent任务

rohanpaul_ai · x · 2026-08-06

一场有趣的智能体能力测试让 Qwen、DeepSeek、Kimi 和 GPT-5.6 四大前沿模型分别构建了 3D 魔方和棋盘,并与 Claude Opus 5 对弈国际象棋(最终均败给 Opus 5)。

实验中,DeepSeek V4 Flash 的表现尤为引人关注。尽管它在 token 层面的推理效率并不高——消耗了高达 2740 万个 token 并重试了 5 次才成功搭建运行环境,但最终完成这两项复杂任务仅花费了 0.557 美元。

这表明,评估智能体效率的范式可能正在改变:即便模型推理相对低效,只要推理成本足够低廉,使得近乎无限的免费重试成为可能,它在经济层面上依然是非常实用且高效的。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →