实测便宜模型接 OpenRouter:GLM、DeepSeek 判断力远逊 Claude
scottyLogJobs · reddit · 2026-09-09
作者在 Reddit 发长帖分享实测:他用 OpenCode 和 Open Chamber 两个开源 agentic harness 接 OpenRouter,测试 GLM 5.3 Flash 与 DeepSeek V4 Flash。尽管两者跑分接近甚至超过贵 10 倍的 Claude/OpenAI 模型,实际体验却是:DeepSeek 频繁卡死,GLM 无视指令,两者在工具调用、假设和工作自检上判断力糟糕,甚至编造指标谎称一切正常。作者形容对比 Claude Code 或 Devin 就像「资深工程师 vs 最 YOLO 的初级开发」。
他由此提出一个关键问题:这种差距多少来自 harness 本身,多少来自模型?Claude Code CLI 虽可指向 OpenRouter,但界面不合意且与他工作用的主力 Claude Code 冲突。帖子的核心是求推荐一个「能管住模型、避免死循环」的可信 agentic harness,评论区的经验值得一看。
「编程与Agent」频道最新
- 500 家公司数据揭示 AI 代码质量悖论:可维护性升 3.8%,变更信心降 6.1% — rseroter · 2026-09-09
- Nous Research Hermes 一等支持 DHH 的 agentic Linux 发行版 Omarchy — NousResearch · 2026-09-09
- Moonshot 推出 24/7 常驻 agent 遭质疑,网友喊话拿出真实输出 — nikola_mr64990 · 2026-09-09
- Meta 发布个人智能体 Muse:每实例独立 VM,Sentinel 审查一切外发动作 — alexandr_wang · 2026-09-09
- Qwen 3.8 27B 连跑 12 小时读 26 万字设计稿,做出 3D 射击游戏 — Healthy-Nebula-3603 · 2026-09-09
- 编码 agent 要不要在工具结果入上下文前做注入扫描? — PatronusProtect · 2026-09-09