Agent developer seeks failover patterns after single-provider outage killed every run

Arkupathak · reddit · 2026-09-27

A developer describes how a single-provider setup caused every agent run to fail when that provider degraded, and is now designing automatic fallback: if model A errors or times out, retry on an equivalent model elsewhere. He asks three open questions: fall back to the same model on another host or a different model (prompts don't always carry over); build it yourself or use a gateway (LiteLLM, Portkey, llmapi.ai all advertise fallbacks); and how to keep fallbacks from quietly running up costs by landing on pricier models.

Original post →

More from coding & agent

coding & agent channel →