求推荐:用于测试编程子智能体推理能力的评测框架

Different-Monk5916 · reddit · 2026-08-01

社区用户发帖求助:正在寻找合适的 benchmark(基准测试)或代码库,用于评估自定义的编程子智能体(Sub-agents)。

该开发者表示,他希望重点测试这些辅助智能体在纯思考和推理(pure thinking and reasoning) 方面的能力,特别是在辅助编程设计和调试逻辑上的表现,因此向社区征集常用的评估工具和框架推荐。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →