LLM 每次生成不同的 Agent 流水线,属性断言成测试新思路

Repulsive_Sugar_5252 · reddit · 2026-09-18

作者在做 hospilot:用 LLM 根据目标文本动态决定由哪些 agent 组成流水线及执行顺序,而非从固定列表挑选——这正是它对未预定义任务有用的原因。

痛点:几乎相同的 prompt 跑两次会得到不同的 agent 图,两者通常都对、只是不同。有人工盯着时无所谓,但写『给定目标 X 流水线应当是 Y』这类测试时,输出不可复现,传统测试的确定性假设(同输入同输出)完全失效。

当前的替代方案:不做精确匹配断言,改为属性断言——检查图中是否包含该类目标必需的 agent、是否遵守传入的约束、是否避开超出范围的东西。比精确匹配弱,但至少测了真实的东西,而不是『输出是否和上周二一样』。

作者在征求更好的做法:测试『允许变化但不允许错误』的 LLM 决策,像是自成一体的一门学科,常见测试建议几乎都用不上。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →