实测便宜模型接 OpenRouter:GLM、DeepSeek 判断力远逊 Claude

scottyLogJobs · reddit · 2026-09-09

作者在 Reddit 发长帖分享实测:他用 OpenCode 和 Open Chamber 两个开源 agentic harness 接 OpenRouter,测试 GLM 5.3 Flash 与 DeepSeek V4 Flash。尽管两者跑分接近甚至超过贵 10 倍的 Claude/OpenAI 模型,实际体验却是:DeepSeek 频繁卡死,GLM 无视指令,两者在工具调用、假设和工作自检上判断力糟糕,甚至编造指标谎称一切正常。作者形容对比 Claude Code 或 Devin 就像「资深工程师 vs 最 YOLO 的初级开发」。

他由此提出一个关键问题:这种差距多少来自 harness 本身,多少来自模型?Claude Code CLI 虽可指向 OpenRouter,但界面不合意且与他工作用的主力 Claude Code 冲突。帖子的核心是求推荐一个「能管住模型、避免死循环」的可信 agentic harness,评论区的经验值得一看。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →