独立开发者求测试 AI 智能体评估工具 Behave

One-Solution-240 · reddit · 2026-08-14

开发者正在寻找 5-10 名用户帮忙测试其开源 AI agent 评估工具 Behave。

该工具专注于多轮对话中的复杂表现评估,而非简单的对错判断。它能捕捉以下问题:

目前该工具已具备测试打分、失败追踪、多轮对话、基线对比和统计分析等基础设施。作者希望使用者能尝试“搞坏”它,找出评估盲点。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →