DeepSeek 新模型实测:长上下文表现佳,工具调用易踩坑
TheZachMueller · x · 2026-08-01
开发者在通宵测试了疑似 DeepSeek v4-flash(0731版)模型后,给出了初步正面评价。但他指出,该模型的提示词格式以及工具调用/对话历史机制存在一些怪异之处,这可能导致初期集成时出现诸多问题,预计会有褒贬不一的反馈,不过部分差评可能是由于用户使用不当或测试框架错误造成的。
在随后的编程 Agent 压力测试(gauntlet)中,测试者发现模型在处理任务时的耐力极强,不得不将其放弃任务前的 token 上限从 20 万提高到了 30 万以上。
所属事件:DeepSeek V4 Flash 实测:长上下文优异但集成易踩坑(3 条相关)→
「编程与Agent」频道最新
- Mireye 推出地理空间 API,让 AI 智能体读懂物理世界 — ycombinator · 2026-08-01
- 开发者用 Claude Opus 与 Codex 快速打造 3D 网页游戏 — simonxxoo · 2026-08-01
- AI 编程效果差异核心:在于极致迭代与系统架构设计 — kevinnbass · 2026-08-01
- Every 发布 AI 智能体语音交互实操指南 — every · 2026-08-01
- LangChain 15分钟解析:Deep Agents 概念与生产实践 — LangChain · 2026-08-01
- 谷歌 Gemini 企业级平台 Agent 评估工具全面转正 — rseroter · 2026-08-01