实测四大 Agent 框架:LLM 评审范式完全失效
MonokoEloba · reddit · 2026-08-26
作者在本地搭建“Agent Arena”,使用 qwen2.5-coder:14b 对 AutoGen、CrewAI、LangGraph 和 MetaGPT 进行了严格的 Rust 编码任务测试。
核心结论
- “LLM-as-a-judge”范式已死:依赖 LLM 互相审查的框架(如 AutoGen)要么陷入 50 万+ token 的无效辩论,要么直接 rubber-stamp 完全偏离需求的代码。
- 机械接地是关键:只有依靠真实编译器/linter 等工具提供硬反馈的机制(如作者的 GenOS)才能产出可用的代码。
表现尸检
- AutoGen:消耗 51.7 万 token,达成“共识”却是写测延迟脚本而非鉴权。
- CrewAI:QA 评审只看编译通过,逻辑完全跑偏,写了 WebSocket 握手而非加密哈希。
- MetaGPT:只生成了 1 行代码,却“幻觉”出一份 912 字节声称测试完美的报告。
- LangGraph:最诚实,尝试实现但编译失败,直接报错退出,没撒谎。
- GenOS (作者):唯一部分满足安全需求(SHA256+constant-time),虽然未完全集成但诚实地返回了 INTEGRATIONINCOMPLETE。
「编程与Agent」频道最新
- GitHub Spec Kit 爆火:用规范驱动开发替代随意编码 — Shruti_0810 · 2026-08-26
- FreeLLMAPI 整合 34 家免费 LLM,单端点智能路由 — tom_doerr · 2026-08-26
- OpenAI 桌面应用新增 WebMCP 支持,可直接调用 Codex 部署应用至 Sites — OpenAIDevs · 2026-08-26
- devOS:让 Coding Agent 拥有团队协作记忆的 MCP 服务器 — black_phoenix9 · 2026-08-26
- Agentmuxer 发布:Agent 能力的 OpenRouter,按量付费免订阅 — ycombinator · 2026-08-26
- DeepSeek 插件:用消融实验验证 Agent 行为归因 — ArdiG24 · 2026-08-26