LLM 每次生成不同的 Agent 流水线,属性断言成测试新思路
Repulsive_Sugar_5252 · reddit · 2026-09-18
作者在做 hospilot:用 LLM 根据目标文本动态决定由哪些 agent 组成流水线及执行顺序,而非从固定列表挑选——这正是它对未预定义任务有用的原因。
痛点:几乎相同的 prompt 跑两次会得到不同的 agent 图,两者通常都对、只是不同。有人工盯着时无所谓,但写『给定目标 X 流水线应当是 Y』这类测试时,输出不可复现,传统测试的确定性假设(同输入同输出)完全失效。
当前的替代方案:不做精确匹配断言,改为属性断言——检查图中是否包含该类目标必需的 agent、是否遵守传入的约束、是否避开超出范围的东西。比精确匹配弱,但至少测了真实的东西,而不是『输出是否和上周二一样』。
作者在征求更好的做法:测试『允许变化但不允许错误』的 LLM 决策,像是自成一体的一门学科,常见测试建议几乎都用不上。
「编程与Agent」频道最新
- 开发者争论:丢弃 tool calls 做上下文压缩是否实用 — zeeg · 2026-09-18
- Muse Agent 自主装 PyTorch 与深度模型,在自有 VM 上远程驱动机器人 — armand_ruiz · 2026-09-18
- 开源 agent Benzi 少读代码反超大厂,基准测试成绩亮眼 — DonkeyTheKing · 2026-09-18
- 晒出完整冷启动 prompt:让 Grok bot 自主爬上 Arena 排行榜第一 — tetsuoai · 2026-09-18
- DeepSeek V4.1-Flash 对比 V4-Pro:省钱三倍,但速度质量逊色 — Arindam_1729 · 2026-09-18
- Agent 编码真正失败模式:代码对但想法错 — gandazgul · 2026-09-18