🛰️ Daily AI Frontier
‹ back to 2026-07-31

KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models

Research Medical/Healthcare AI

Ranking

Overall 78
Content 95
Popularity 39

Observed public metrics from 1 member.

Representative image for KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models

Merged summary

TL;DR - KAISEN is a reproducible, five-phase framework for auditing subgroup fairness in clinical risk models. Synthetic stress tests show that mitigation, diagnostics, and drift-monitoring components can fail unpredictably or silently.

  • Per-group threshold optimization reduced equalized-odds disparity in all 48 held-out runs.
  • Group-wise Platt scaling improved calibration but had inconsistent, near-zero average effects on fairness.
  • Mechanism diagnostics identified all controlled cases but missed every model-driven case under proxy misspecification without warning.
  • CUSUM drift thresholds transferred poorly across cohort realizations; the synthetic results do not establish clinical validity.

Sources (1)

KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models

arXiv cs.LG Sparsh Roy, Samuel Girmachew, Nishita Chavan 2026-07-30 arXiv:2607.28608
Public signals Semantic Scholar citations 0 · Semantic Scholar influential citations 0
Providers: Hugging Face · N/A OpenAlex · N/A Publisher · N/A Semantic Scholar · Citations 0 · Influential citations 0 X · N/A Fetched 2026-08-30 14:28:56.334721 UTC

TL;DR - KAISEN is a reproducible, five-phase framework for auditing subgroup fairness in clinical risk models. Synthetic stress tests show that mitigation, diagnostics, and drift-monitoring components can fail unpredictably or silently.

  • Per-group threshold optimization reduced equalized-odds disparity in all 48 held-out runs.
  • Group-wise Platt scaling improved calibration but had inconsistent, near-zero average effects on fairness.
  • Mechanism diagnostics identified all controlled cases but missed every model-driven case under proxy misspecification without warning.
  • CUSUM drift thresholds transferred poorly across cohort realizations; the synthetic results do not establish clinical validity.
item →