开源LongCat-2.0在编码任务中追平GPT-5.5
rohanpaul_ai · x · 2026-07-08
美团开源的 LongCat-2.0 是一个约 1.6T 参数的 MoE 模型。在 atomic.chat 用 @kilocode CLI 进行的本地 agent 测试中,LongCat-2.0 在“Duck Hunt(打鸭子)”游戏编码任务上与 GPT-5.5 表现接近:本地消耗约 70.3K tokens、成本为 $0,而云端 GPT-5.5 消耗 64.9K tokens、成本 $0.65。
任务并非直接回答提示词,而是要求 agent 实际构建并迭代修改代码。LongCat 据称较好地处理了鸭子、波浪、弹药、命中物理、下落动画以及狗叼回循环等逻辑,在三轮迭代的 agent 工作流中表现具备竞争力。
所属事件:美团开源万亿参数MoE模型LongCat-2.0(2 条相关)→
「编程与Agent」频道最新
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11