Microsoft-Tsinghua Paper Boosts Agent Failure Diagnosis with Structured Run Views

A Microsoft-Tsinghua paper shows that structured run views, using behavioral abstraction and neural invariants, raise GPT-5.1's agent failure localization success from 3.6% to 31.4%, avoiding misattribution from raw conversation histories.

2026-09-09 ~ 2026-09-09 · 2 related posts