Módulo 2: Bias and Fairness — Detection, Measurement, Mitigation

5. Impossibility Theorems y Trade-offs

Descripción de la cápsula

Es la cápsula matemáticamente más densa del módulo. Y la más importante para no caer en falsa confianza.

Hechos formalmente probados (Chouldechova 2017, Kleinberg-Mullainathan-Raghavan 2017):

No podés satisfacer simultáneamente demographic parity, equalized odds, y calibration excepto en casos triviales (cuando los grupos tienen distribuciones idénticas).

Esto no es opinión filosófica. Es teorema matemático. Y tiene implicaciones directas para tu trabajo:

  1. Cuando un PM diga "satisfagamos todas las fairness metrics", la respuesta correcta es "matemáticamente imposible. Tenemos que elegir."

  2. Esa elección no es técnica solamente — es socio-técnica. Requiere decisión sobre qué tipo de fairness priorizamos, basado en values y context.

  3. Documentar la elección y el trade-off es parte de tu responsabilidad ética. No esconderlo.

Esta cápsula te da la herramienta intelectual para navegar este trade-off honestamente.


Los dos teoremas principales

Teorema 1: Chouldechova (2017)

Setup: classifier que predice binary outcome con score continuo.

Resultado: en general, no podés tener simultáneamente:

  • Calibration: P(Y=1 | S=s, A=a) = s ∀ s, a.
  • Equal Predictive Value: P(Y=1 | Ŷ=1, A=a) = P(Y=1 | Ŷ=1, A=b).

Excepciones triviales: cuando los grupos tienen base rates idénticos (P(Y=1 | A=a) = P(Y=1 | A=b)).

En lenguaje práctico: si los grupos tienen rates de outcome distintos en realidad, elegir entre calibration y equal predictive value es inevitable.

Teorema 2: Kleinberg-Mullainathan-Raghavan (2017)

Setup: classifier con score, threshold-based decisions.

Resultado: en general, no podés tener simultáneamente:

  • Calibration entre grupos.
  • Balance for the negative class (FPR igual entre grupos).
  • Balance for the positive class (TPR igual entre grupos).

Excepciones triviales: cuando base rates son idénticos, o cuando el modelo es perfecto (zero error).

Implicación: si querés equalized odds (TPR igual + FPR igual), tenés que sacrificar calibration. Si querés calibration, tenés que sacrificar equalized odds.

Por qué importa

Para sistemas reales:

  • Loans: defaultantes y no-defaultantes tienen base rates distintos entre grupos demográficos en data real.
  • Hiring: qualified rate puede diferir.
  • Medical diagnosis: prevalencia de condiciones difiere.

Excepción trivial casi nunca aplica en sistemas reales. Trade-off es inescapable.


El ejemplo COMPAS otra vez

Para hacer concreto el conflict:

COMPAS (Correctional Offender Management Profiling for Alternative Sanctions) predice recidivism para defendants en US criminal courts.

ProPublica (2016) midió equalized odds:

GrupoTPR (recidivism predicted correctly)FPR (no-recidivists labeled as risk)
Black defendants65%45%
White defendants60%23%

False positive rate 2x más alto para black defendants. Esto significa: black defendants etiquetados como "high risk" eran en realidad no-recidivists con tasa significativamente mayor que white defendants.

ProPublica conclusion: discriminatorio.

Northpointe (vendor) respondió midiendo calibration:

ScoreRecidivism rate (Black)Recidivism rate (White)
Score 1-322%21%
Score 4-641%39%
Score 7-1068%65%

Score = X significa similar recidivism rate para ambos grupos. Calibration ✅.

Northpointe conclusion: bien calibrado, no discriminatorio.

¿Quién tenía razón?

Ambos. Por Chouldechova/Kleinberg, calibration y equalized odds no pueden coexistir cuando grupos tienen base rates distintas.

Black defendants tienen recidivism rate más alto en el dataset (no es controversial — es hecho del dataset). Por eso satisfacer calibration fuerza mayor FPR para ellos.

La conclusion correcta NO es "ProPublica vs Northpointe":

  • ProPublica argued que en criminal justice, equalized odds debería priorizarse: false positives → encarcelamiento o sentence más severa de personas no recidivists.
  • Northpointe argued que calibration es transparency básica: score consistente entre grupos.

Ambas posiciones son matemáticamente legítimas. La decisión es policy choice, no technical.

Lo que faltó

Lo que Northpointe debió haber documentado explícitamente:

"Este modelo prioriza calibration. Como consecuencia matemática (Chouldechova theorem), tiene FPR mayor para grupos con base rates más altos. En el dataset disponible, eso afecta principalmente a black defendants. Stakeholders deben evaluar si este trade-off es aceptable para uso en criminal sentencing."

Honesty intelectual requiere reconocer el trade-off, no defender el modelo como "completamente fair".


Cómo elegir cuál métrica priorizar

Framework de decisión

PreguntaSi SÍ → priorizar
¿El score se usa directamente (no solo binary)?Calibration
¿Errores tienen impacto severo en personas?Equalized odds
¿No hay ground truth confiable?Demographic parity
¿Marco legal lo dicta?Lo que requiera la regulación
¿Stakeholders requieren score interpretable consistente?Calibration
¿Equity de outcomes es el goal explícito?Demographic parity o equalized odds

Por industry

Hiring:

  • Equalized odds prioritary: false positives (rechazar qualified) y false negatives (aceptar non-qualified) deben ser equitativos.
  • Demographic parity también si policy requirement.
  • Calibration menos crítico (score raramente comunicado a aplicantes).

Lending:

  • Equalized odds: equity en errores tiene impacto financiero directo.
  • Calibration importante para risk-based pricing.
  • Demographic parity puede ser problemática (forzar approve a high-risk = harm to borrower).

Healthcare:

  • Calibration crítico (scores se usan para risk stratification, treatment decisions).
  • Equalized odds para diagnostic systems (false negatives son críticos).
  • Demographic parity raramente apropiado (base rates varían biológicamente).

Criminal Justice:

  • Equalized odds (false positives → libertad perdida).
  • Calibration secundario.

Advertising / Recommendation:

  • Demographic parity often appropriate (no ground truth claro).
  • Calibration importante para CTR predictions.
  • Equalized odds menos relevant.

Documentar la elección

Tu Bias Audit debe incluir:

## Fairness Metric Decision

We have chosen to prioritize **[METRIC NAME]** for this system.

**Rationale**:
- [Reason 1, e.g., "Errors have direct impact on persons (loans denied)"]
- [Reason 2, e.g., "Ground truth (default) is verifiable"]
- [Reason 3, e.g., "Equity of errors aligns with our stakeholder values"]

**Trade-offs accepted**:
- We will likely **not** satisfy [OTHER METRIC] perfectly.
- Concretely: [describe the gap, e.g., "demographic parity ratio expected ~0.85"]

**Documented by**: [author], [date]
**Reviewed by**: [stakeholders]
**Re-evaluation**: [date 6-12 months out]

Esa documentation es lo que protege ante regulator/auditor scrutiny. "Elegimos priority X por reason Y" es defensible. "No miramos las métricas" no lo es.


Cuando NO hay solución técnica

A veces, el resultado de impossibility theorems es que no hay sistema fair viable. Ejemplos:

Caso: criminal recidivism con desigualdades sistémicas

Si la sociedad tiene desigualdades sistémicas (oportunidades económicas, educación, policing differential), el dataset histórico de recidivism va a reflejar esas desigualdades. Cualquier modelo basado en ese dataset reproducirá el bias estructural.

No hay arreglo técnico que no sea cosmético. La solution es policy/system level: invertir en oportunidades, reformar policing, etc.

Aplicar AI a este caso es simplemente automatizar el sesgo histórico con veneer de objetividad.

Decisión ética válida: no construir el sistema. O construirlo solamente como advisory, never authoritative.

Caso: hiring con highly skewed historical data

Si tu dataset histórico tiene 90% hombres y 10% mujeres en roles X, cualquier modelo va a heredar ese skew. Aplicar fairness constraints puede mitigar pero raramente eliminar.

Alternativa válida: NO usar histórico data para training. En su lugar, definir criteria explícitos (skills, experience requirements) y usar AI solo para structured matching, no learning de outcomes.

Conclusión

Honesty intelectual: a veces, las herramientas técnicas son insuficientes. Reconocerlo es parte de la responsabilidad. La elección puede ser:

  1. Aplicar las mejores técnicas y documentar trade-offs (común).
  2. Rediseñar el sistema para evitar el problema (mejor).
  3. No construir el sistema (válido en algunos casos).

Trade-offs entre fairness y accuracy

Otro trade-off importante: fairness constraints often reduce accuracy.

Por qué

El modelo "más accurate" sobre datos históricos puede serlo precisamente por capturar bias. Si el bias es predictivo (en el dataset), eliminarlo reduces predictive power.

Cuanto?

Depende del case. Usualmente:

  • Mitigations leves (re-balancing): 0-2% accuracy loss.
  • Mitigations medianas (post-processing thresholds): 2-5%.
  • Mitigations agresivas (adversarial debiasing): 5-15%.

Cómo decidir cuánto sacrificar

Framework:

  1. Establish minimum fairness threshold que es no negociable.
  2. Establish minimum accuracy threshold required for system to be useful.
  3. Find Pareto frontier entre los dos.
  4. Choose point on frontier que satisface ambos thresholds.

Si no existe punto que satisface ambos, el sistema no debe deployarse as designed. Volver a Fase 5 del Impact Analysis.

Documentation

## Fairness vs Accuracy Trade-off

**Without fairness constraints**:
- Accuracy: 92%
- Demographic parity ratio: 0.55 (fails 4/5 rule)

**With fairness mitigations**:
- Accuracy: 88% (4 points lower)
- Demographic parity ratio: 0.85 (passes 4/5 rule)

**Decision**: deploy con mitigations. Accuracy 88% above minimum useful threshold (85%). Fairness above legal threshold.

**Monitoring**: re-evaluate every 6 months. If accuracy drops below 85% with drift, retrain.

Mitigation techniques previewed

Para resolver trade-offs, hay tres categorías de mitigation (cubrimos detalles en cápsulas 06-07):

Pre-processing: modificar training data antes de entrenar.

  • Re-balancing groups.
  • Data augmentation para grupos under-represented.
  • Re-weighting samples.

In-processing: modificar el algoritmo de training.

  • Fairness constraints en loss function.
  • Adversarial debiasing.
  • Multi-task learning con fairness as task.

Post-processing: modificar predictions del modelo entrenado.

  • Threshold tuning per group.
  • Calibration adjustment.
  • Reject option en zonas marginales.

Cada categoría tiene sus pros/cons. Cápsulas 06-07 los cubren.


Trampas y errores comunes

1. "Vamos a satisfacer todas las métricas"

Matemáticamente imposible. Si alguien lo pide, educá: "Por Chouldechova theorem, no podemos. Tenemos que elegir cuál priorizar."

2. "Si elegimos métrica X, somos fair"

No. Sos fair respecto a métrica X. Vas a fallar en Y y Z. Documentar honest.

3. "Sin trade-off"

Cuando alguien dice "esta solución no tiene trade-off", desconfiá. Si no ves el trade-off, probablemente no estás midiendo todo.

4. Negar el trade-off accuracy/fairness

A veces existe, a veces no. Pretender que nunca existe es deshonesto. Pretender que siempre existe (y por ende no aplicar fairness) también.

5. Aplicar mitigations sin medir effect

Aplicaste re-balancing, ahora "es fair". ¿Verificaste? Mediste post-mitigation las tres métricas? Si no, no sabés.


Auto-verificación

1. ¿Cuándo NO aplican los impossibility theorems?

Casos triviales donde aplica solución única:

  1. Base rates idénticas entre grupos: P(Y=1 | A=a) = P(Y=1 | A=b) ∀ a, b.

  2. Modelo perfecto (zero error): si vas a tener accuracy 100%, no hay errores que distribuir desigualmente.

En sistemas reales, prácticamente nunca se cumple ninguno:

  • Base rates difieren entre grupos demográficos por razones históricas, sociales, biológicas.
  • Modelos no son perfectos.

Por lo tanto, en práctica, los trade-offs son inescapables.

Implicación: cuando alguien diga "satisfagamos todas las métricas", la respuesta es "matemáticamente imposible en este context. Elegimos cuál priorizar."

2. ¿Quién tenía razón en COMPAS, ProPublica o Northpointe?

Ambos tenían razón en lo que medían. ProPublica midió equalized odds (FPR diff 22 puntos para black). Northpointe midió calibration (similar para ambos grupos). Los dos resultados son matemáticamente correctos.

El conflicto real es policy: ¿qué tipo de fairness priorizamos en criminal justice?

  • ProPublica argument: equalized odds (false positives → libertad perdida).
  • Northpointe argument: calibration (transparency en scores).

Ambas posiciones son legítimas. La decisión es socio-técnica, no math:

  • ¿Qué valoramos como sociedad?
  • ¿Qué requiere la ley?
  • ¿Qué los stakeholders consideran aceptable?

Lección general: si un modelo afecta high-stakes decisions, los stakeholders (no solo engineers) deben elegir conscientemente cuál métrica priorizar, con full understanding del trade-off.

3. ¿Cómo elegirías métrica para un sistema de hiring?

Framework:

  1. Hay ground truth? Sí (hires que performaron well/badly post-hire).
  2. Errores tienen impacto severo? Sí (false negatives = qualified candidate rejected; false positives = hire poor fit).
  3. Score se usa directamente? No (binary "interview" o "no").
  4. Marco legal? US EEOC framework (4/5 rule = demographic parity-adjacent).

Decision: priorizar equalized odds (errores equitativos) y monitorear demographic parity (compliance legal).

Trade-off accepted: calibration probablemente no satisfecha (irrelevant porque score no se usa directly).

Documentation:

"We prioritize equalized odds: TPR difference < 5%, FPR difference < 5%. Demographic parity ratio monitored to ensure 4/5 rule compliance. Calibration not explicitly enforced because hiring decisions are binary, not score-driven."

Documentar es defendible. No documentar abre exposure.

4. ¿Cuándo es éticamente apropiado NO construir el sistema?

Cuando:

  1. No hay solución técnica viable: trade-off entre fairness metrics no permite punto aceptable + accuracy threshold no lograble.

  2. Bias estructural en data hace cualquier modelo unavoidably biased: ej., recidivism con datasets reflejando policing differential históricamente.

  3. El sistema replica desigualdades sistémicas: aplicar AI no resuelve el problema social subyacente, solo lo automatiza con veneer de objetividad.

  4. Costo de prevención excede beneficio del sistema: si necesita 5 años de bias mitigation work para deploy responsable, business case puede no soportar.

  5. Use case es inherentemente problemático: facial recognition para policing, en context donde regulation está moviéndose hacia banning, puede no ser viable.

En estos casos, "no construir" o "construir como advisory only, never authoritative" es decisión válida y a veces requerida.

Esto requiere alza de voz por parte del engineer. PMs/stakeholders no lo van a sugerir — ellos quieren shipear. Engineer tiene la información técnica para argumentar (con análisis y números) que algunos sistemas no deberían existir as designed.


Resumen y siguiente paso

  • Impossibility theorems (Chouldechova, KMR) demuestran que no podés satisfacer todas las fairness metrics simultaneamente cuando grupos tienen base rates distintas (lo cual es siempre en práctica).
  • COMPAS ejemplo: ProPublica vs Northpointe son ambos correctos en lo que miden — el conflict es policy, no math.
  • Elegir métrica es decisión socio-técnica. Por industry:
    • Hiring → equalized odds.
    • Lending → equalized odds + calibration.
    • Healthcare → calibration crítico.
    • Criminal justice → equalized odds (false positives = libertad).
    • Advertising → demographic parity.
  • Documentar la elección + trade-offs + monitoring es defensa contra regulator scrutiny.
  • A veces la answer correcta es "no construir el sistema as designed".

Checkpoint: deberías poder articular por qué ningún sistema puede satisfacer "todas las métricas de fairness" simultaneamente, y elegir métrica principal según context.

Puente a la siguiente cápsula: las cápsulas 02-05 cubrieron medición y detección. Las cápsulas 06-07 cubren mitigación: qué hacer cuando detectás bias. La cápsula 06 trata pre-processing mitigations (modificar data antes de training): re-balancing, re-sampling, augmentation, re-weighting. Son las técnicas más simples y a menudo efectivas.


Recursos

  1. Chouldechova (2017) — paper original.
  2. Kleinberg-Mullainathan-Raghavan (2017) — paper original.
  3. The Mythos of Model Interpretability (Lipton, 2016) — context relacionado.
  4. Fair ML Book — Chapter 4 — explicación pedagógica.
  5. Northpointe response to ProPublica — para perspective.

Siguiente: 06-mitigacion-pre-processing.md — Mitigation pre-processing: modificar data antes de training.

Cápsula 05 de 08 — Módulo 2 — AI Ethics & Compliance Guide