Share of evaluation cases that previously passed and now fail after a model, prompt or retrieval change.
Previously passing cases now failing ÷ previously passing cases × 100
Zero on high-consequence cases