DeepSeek级联方案实测:编码任务胜率超GPT-5.6且成本降37%
togethercompute · x · 2026-08-08
Together Compute 团队对 DeepSeek V4 Flash 和 GPT-5.6 Luna 在 DeepSWE(软件工程智能体基准)上进行了对比测试。
结果显示,采用以 DeepSeek 为主导的级联架构(Cascade),结合测试套件验证机制,其解决的编码任务数量超过了单独使用 Luna 的方案,并且将单任务处理成本大幅降低了 37%。
所属事件:DeepSeek-V4 Flash实测:成本仅Luna六分之一,性能达八成(14 条相关)→
「编程与Agent」频道最新
- Claude Code 支持跨会话通信,多智能体协同更顺畅 — goyalshaliniuk · 2026-08-08
- 解锁 Claude Opus 正确姿势:清空预设并只下达目标 — MartinGTobias · 2026-08-08
- AI 安全面试题:如何编写完全阻断 SSH 出站的沙盒 — nptacek · 2026-08-08
- Claude Code 误判网络安全内容,强制清空用户工作进度 — ivan_bezdomny · 2026-08-08
- Claude Code 更新:新增工作区信任机制与额度限制提示 — ClaudeCodeLog · 2026-08-08
- Claude Code CLI 更新:修复编辑误删与网关额度提示 — ClaudeCodeLog · 2026-08-08