实测四大前沿模型:DeepSeek靠极低推理成本逆袭复杂Agent任务
rohanpaul_ai · x · 2026-08-06
一场有趣的智能体能力测试让 Qwen、DeepSeek、Kimi 和 GPT-5.6 四大前沿模型分别构建了 3D 魔方和棋盘,并与 Claude Opus 5 对弈国际象棋(最终均败给 Opus 5)。
实验中,DeepSeek V4 Flash 的表现尤为引人关注。尽管它在 token 层面的推理效率并不高——消耗了高达 2740 万个 token 并重试了 5 次才成功搭建运行环境,但最终完成这两项复杂任务仅花费了 0.557 美元。
这表明,评估智能体效率的范式可能正在改变:即便模型推理相对低效,只要推理成本足够低廉,使得近乎无限的免费重试成为可能,它在经济层面上依然是非常实用且高效的。
「编程与Agent」频道最新
- Claude Code 子智能体实战:限制层级与范围才是制胜关键 — PrajwalTomar_ · 2026-08-06
- 实测AI Agent:少即是多,过度堆砌上下文反而拉胯 — jasonkneen · 2026-08-06
- Notion 开放自定义交互式区块早期测试,可读取工作区数据 — ivanhzhao · 2026-08-06
- 开源框架 GraphARC:用本地 Qwen 8B 构建可控调查智能体 — Desperate-Ad-9679 · 2026-08-06
- 开发者将体育博彩模拟器封装为 MCP 服务器,让 LLM 精算赔率 — negative__ev · 2026-08-06
- 8岁小孩用AI Studio花4小时做出32关游戏 — fofrAI · 2026-08-06