同一 prompt 跑遍多框架,工具并排对比 agent 执行轨迹
AU1CII · reddit · 2026-09-22
Reddit 用户 AU1CII 做了一个小型对比工具,想回答一个核心问题:agent 底层架构在实践中到底有多重要?
- 工具用完全相同的 prompt,在不同框架、模型、推理模式和工具策略下运行,然后并排展示执行轨迹
- 目前支持:原生 agent、LangChain / LangGraph、Plan/Execute、Self-Critique、AutoGen、CrewAI
- 项目仍处早期,目标是把架构差异变得可视化、易评估
- 作者自称刚入门 agent 开发,征求反馈:并排轨迹对比是否实用、还该比哪些维度
「编程与Agent」频道最新
- Codex 手机远程操控上线,开发者哀叹「我的人生完了」 — gowthami_s · 2026-09-22
- 开发者 vibe coding 出 DuckDB 扩展,5 天即有客户付费 — josh_wills · 2026-09-22
- GPT-6 Astra 仅靠截图和键鼠输入自己学会玩《辐射2》 — Vjeux · 2026-09-22
- Google 提出 RRSI:正则化约束 Agent harness 递归自我改进,OOD 仍涨 4.7 分 — google · 2026-09-22
- Reddit 讨论:用户侧 Agent 生产环境的会话、观测与成本控制 — YamSpiritual1964 · 2026-09-22
- 团队实战复盘:开发 eval harness 踩过的 53 个坑 — DrDatta_AIIMS · 2026-09-22