DeepSeek 新模型实测:长上下文表现佳,工具调用易踩坑

TheZachMueller · x · 2026-08-01

开发者在通宵测试了疑似 DeepSeek v4-flash(0731版)模型后,给出了初步正面评价。但他指出,该模型的提示词格式以及工具调用/对话历史机制存在一些怪异之处,这可能导致初期集成时出现诸多问题,预计会有褒贬不一的反馈,不过部分差评可能是由于用户使用不当或测试框架错误造成的。

在随后的编程 Agent 压力测试(gauntlet)中,测试者发现模型在处理任务时的耐力极强,不得不将其放弃任务前的 token 上限从 20 万提高到了 30 万以上。

所属事件:DeepSeek V4 Flash 实测:长上下文优异但集成易踩坑(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →