Simulated user drops agent success from 100% to 60%, UiPath open-sources dialog-mode eval harness

EvalRaccoonDev · reddit · 2026-09-23

UiPath argues most agent evals hand the model a perfect prompt, which is unrealistic. Their open-source eval harness codereval includes a simulated user that knows the requirements but only answers when asked.

Results across 5 tasks:

The harness and dialog-mode docs are open source.

Original post →

More from coding & agent

coding & agent channel →