Claude Sharpens Safety Guardrails, Cutting False Refusals by Up to 85%

Anthropic improved Claude's safety guardrails, cutting false-positive refusals on benign cybersecurity requests by about 60% and fallback rates on basic biology and medicine questions by about 85%, while still routing sensitive tasks to Opus.

2026-09-02 ~ 2026-09-02 · 4 related posts