Módulo 1: Why Ethics Matters in AI Engineering
3. Case Study #2: Facial Recognition Bias
Descripción de la cápsula
En 2018, Joy Buolamwini (MIT Media Lab) y Timnit Gebru publicaron Gender Shades — un estudio que medía el accuracy de tres sistemas comerciales de reconocimiento facial (IBM, Microsoft, Face++) en clasificación de género por intersección raza/género. Los resultados fueron escandalosos:
- Hombres blancos: error rate 0.8%.
- Mujeres negras: error rate 34.7%.
- Diferencia: ~43x peor para mujeres negras.
Ese estudio fue el catalizador. En los 5 años siguientes, arrestos erróneos documentados, prohibiciones municipales (San Francisco 2019, Boston 2020, Portland 2020), moratorios federales propuestos, y demandas civiles millonarias.
Esta cápsula cubre el caso. No es teoría — son personas reales arrestadas, fichadas, y procesadas porque un modelo con error rate desigual fue desplegado en infraestructura de policing sin testing por subgrupo.
Si Amazon Hiring es el caso "se podía revertir antes de que llegara a producción", facial recognition es el caso "ya llegó al mundo físico, hay daños documentados, y la regulación está corriendo para alcanzarlo".
Lo que pasó
Gender Shades (2018)
Buolamwini y Gebru construyeron un test set de 1,270 imágenes de parlamentarios de 3 países africanos y 3 países europeos, balanceado por género (54% mujeres, 46% hombres) y por tono de piel (Fitzpatrick scale).
Lo testearon contra:
- IBM Watson Visual Recognition.
- Microsoft Azure Face API.
- Face++ (empresa china).
Resultados (error rate en clasificación de género binaria):
| Subgrupo | IBM | Microsoft | Face++ |
|---|---|---|---|
| Hombres claros | 0.3% | 0.0% | 0.7% |
| Mujeres claras | 7.1% | 1.7% | 6.0% |
| Hombres oscuros | 12.0% | 5.9% | 0.7% |
| Mujeres oscuras | 34.7% | 20.8% | 34.5% |
El gap entre hombres claros y mujeres oscuras: 30-40 puntos porcentuales. No era marginal — era estructural.
Reacción inicial de las empresas
- IBM (junio 2018): admite el problema, retira el dataset de entrenamiento original y publica un dataset más balanceado ("Diversity in Faces"). En 2020, Arvind Krishna (CEO IBM) anuncia que IBM abandona facial recognition completamente, citando "the fight against racial bias and police misuse".
- Microsoft (junio 2018): lanza versión actualizada con error rates dramáticamente reducidos. Publica un compromiso de no vender facial recognition a policía hasta que haya regulación federal.
- Amazon Rekognition: inicialmente niega que el problema aplique a sus sistemas. Estudios independientes (ACLU 2018, NIST 2019) muestran problemas similares. En 2020, después del homicidio de George Floyd, Amazon impone moratorio de 1 año al uso por policía. Luego extendido indefinidamente.
Casos reales: arrestos erróneos
Los siguientes son casos documentados (2019-2023) donde facial recognition produjo arrestos erróneos de personas inocentes:
Robert Williams (Detroit, 2020)
- Hechos: Williams, hombre negro, fue arrestado en su casa frente a sus dos hijas. Cargos: hurto en una tienda Shinola.
- Evidencia: un match de facial recognition entre un still de seguridad y una foto de su licencia de conducir.
- Realidad: Williams nunca había estado en esa tienda. El match era un falso positivo.
- Procesamiento: detenido 30 horas. Cargos eventualmente desestimados. Demandó a la ciudad de Detroit.
Nijeer Parks (New Jersey, 2019)
- Hechos: Parks, hombre negro, arrestado por shoplifting + fugarse de la policía + agresión.
- Evidencia: facial recognition match con foto de DMV.
- Realidad: Parks estaba a 30 millas del lugar al momento del crimen. Tenía recibos y testigos.
- Procesamiento: detenido 10 días. Cargos desestimados. Demandó.
Randal Reid (Louisiana, 2022)
- Hechos: Reid, hombre negro, arrestado por robo de bolsos de lujo en Louisiana. Vivía en Atlanta y nunca había estado en Louisiana.
- Evidencia: facial recognition match.
- Realidad: identificación errónea total.
- Procesamiento: detenido 6 días. Demandó.
Porcha Woodruff (Detroit, 2023)
- Hechos: Woodruff, mujer negra, embarazada de 8 meses, arrestada en su casa frente a sus hijos. Cargos: robo de auto.
- Evidencia: facial recognition match con una foto de mugshot de 2015.
- Realidad: identificación errónea. Woodruff demandó.
Patrón: en cada caso documentado de arresto erróneo por facial recognition, la víctima fue una persona negra. No es muestra aleatoria — es la consecuencia directa de que el modelo tiene error rates más altos para piel oscura.
Respuesta regulatoria
- 2019: San Francisco se vuelve la primera ciudad US en prohibir uso de facial recognition por agencias municipales.
- 2020: Boston, Portland (OR), Oakland, y otras ciudades siguen.
- 2020-2021: estados como Massachusetts y Virginia limitan el uso por policía.
- 2024: EU AI Act clasifica real-time biometric identification en espacios públicos como "high-risk" o "prohibido" en la mayoría de casos.
- 2024: el estado de New York impone moratoria a uso por escuelas.
Por qué pasó: el mecanismo técnico
Datos de entrenamiento desbalanceados
Los datasets canónicos usados para entrenar reconocimiento facial en los 2010s — LFW (Labeled Faces in the Wild), CelebA, IMDB-Wiki — eran severamente desbalanceados.
LFW (uno de los más usados):
- ~77% hombres.
- ~83% personas de piel clara (Fitzpatrick I-III).
- ~5% personas de piel muy oscura (Fitzpatrick V-VI).
Si entrenás un modelo con esos datos, el modelo ve muchísimos más ejemplos de hombres blancos que de mujeres negras. Como consecuencia, aprende mejor las features distintivas de hombres blancos. Para mujeres negras, tiene menos ejemplos de los cuales generalizar — y el error sube.
Es el mismo principio matemático que cualquier estadístico conoce: menos ejemplos → mayor varianza en estimación → más error. Aplicado a ML: menos training data de un subgrupo → modelo peor en ese subgrupo.
El modelo aprende lo que ve
No es que los modelos sean "racistas" en algún sentido cognitivo. Es que aprenden patrones del dataset. Si el dataset tiene 80% piel clara, el modelo se especializa en piel clara.
La arquitectura técnica también contribuyó:
- Color thresholding tradicional: muchos sistemas pre-2018 usaban thresholds de color asumiendo iluminación uniforme. Piel oscura, en condiciones de iluminación común (oficinas con luz cálida, foto de seguridad nocturna), tiene menos contraste, lo que afecta la detección de features.
- Feature extraction calibrada para iluminación: similar problema. La cara entera puede no ser detectada antes de que el reconocimiento empiece.
Testing inadecuado
Como en Amazon Hiring, los tests tradicionales pasaban. Accuracy global del 95% suena bien — pero esconde 0.8% para hombres blancos y 34.7% para mujeres negras. El promedio es engañoso.
Lo que faltó: disaggregated testing por subgrupo demográfico, reportado explícitamente, y bloqueando deploy si los gaps superaban un umbral.
Buolamwini y Gebru no inventaron una técnica nueva. Solo midieron lo que las empresas no estaban midiendo.
Deploy a high-stakes contexts sin disclaimer
Las empresas vendieron estos sistemas a:
- Departamentos de policía (uso para identificar sospechosos).
- Aeropuertos (verificación de identidad).
- Escuelas (control de acceso).
- Borders (immigration screening).
Estos son high-stakes: errores tienen consecuencias severas (arrestos, deportaciones, denegación de acceso a personas legítimas).
Una decisión ética básica habría sido: NO vender sistemas con error rates desiguales conocidos para uso en high-stakes hasta que los gaps se cerraran. O al menos, vender con requirements explícitos de no-uso solitario (siempre con verificación humana).
Eso no se hizo hasta DESPUÉS de los escándalos.
El costo medible
Costo humano
Cada uno de los arrestos erróneos documentados implicó:
- Detención (horas a días).
- Cargos criminales (que quedan en historial incluso si desestimados).
- Costos legales para defensa.
- Trauma personal y familiar (algunos arrestos frente a hijos).
- Pérdida de empleo en algunos casos.
- Daño reputacional persistente.
Y los documentados son una fracción. Es probable que haya cientos o miles de arrestos por facial recognition con identificaciones erróneas, donde el suspect no demandó y el caso simplemente "salió mal" sin coverage.
Costo financiero para empresas
- IBM: abandonó toda la línea de producto facial recognition (2020). Costo: ingresos perdidos por años + costo de R&D escrito off.
- Amazon Rekognition: moratoria que continúa. Mercado de gobierno US perdido.
- Microsoft: pérdida de mercado government durante moratoria voluntaria.
- Demandas: Robert Williams demandó Detroit por $X millones (settled), Parks demandó NJ, Reid demandó Louisiana.
Total costo financiero conservador en el sector: cientos de millones a billones de dólares en revenue perdido + costos legales + R&D escrito off.
Costo regulatorio
- Decenas de ciudades US con prohibiciones.
- Estados con limitaciones.
- EU AI Act con classificación high-risk/prohibida.
- Reputación de toda la industria de AI dañada.
El caso es citado en cada propuesta legislativa sobre AI risk en US y Europa desde 2019.
Cómo se podía prevenir: técnicas que faltaron
Técnica 1: Disaggregated testing por subgrupo
Faltó: testing reportando accuracy/error por subgrupo demográfico (raza × género) en cada release.
Implementación:
def test_subgroup_performance(model, test_set):
subgroups = test_set.groupby(['race', 'gender'])
results = {}
for name, group in subgroups:
predictions = model.predict(group['image'])
accuracy = (predictions == group['label']).mean()
results[name] = {
'n': len(group),
'accuracy': accuracy,
'error_rate': 1 - accuracy,
}
# Bloqueante: si error rate de cualquier subgrupo > 2x el mejor
best_error = min(r['error_rate'] for r in results.values())
worst_error = max(r['error_rate'] for r in results.values())
if worst_error / best_error > 2:
raise FailedQAGate(
f"Disparate error rates detected. "
f"Best: {best_error:.2%}, Worst: {worst_error:.2%}"
)
return results
Este test, integrado en CI, habría bloqueado los releases problemáticos.
Técnica 2: Datasets balanceados de entrenamiento
Faltó: validar la composición demográfica de los training datasets antes de usarlos.
Implementación: para cada dataset, calcular distribución por demografía (cuando sea inferible). Si subgrupos tienen < 10% representación, ya es señal de futuro sub-performance en ese grupo.
Mitigaciones:
- Oversampling de subgrupos minoritarios.
- Data augmentation específica para piel oscura (con cuidado de no introducir nuevos artifacts).
- Datasets nuevos: como el Diversity in Faces de IBM (2018) o el FairFace (Karkkainen & Joo, 2021).
Técnica 3: Adversarial testing
Faltó: testing con casos edge específicamente diseñados para detectar bias.
Ejemplo: tomar pairs de imágenes que difieren solo en tono de piel (mismo tipo facial, misma pose, distinto tono). Medir si el modelo da resultados consistentes. Si no, hay bias.
Técnica 4: Confidence thresholds explícitos
Faltó: deploy con thresholds de confianza calibrados por subgrupo. Si el modelo tiene 99% confidence para hombres blancos pero 70% para mujeres negras, eso debería propagarse al output.
Implementación: el output del sistema debe incluir el confidence interval, calibrado por subgrupo. Si confidence < threshold, no devolver match — devolver "uncertain, requires human review".
Esto solo, aplicado a los casos de arresto erróneo, los habría prevenido. Williams, Parks, Reid, Woodruff — en cada caso, el confidence del match era incierto, pero el sistema devolvió "match" como si fuera certeza.
Técnica 5: Disclaimer y use restrictions
Faltó: documentación contractual que prohibiera uso solitario en high-stakes decisions.
Implementación: el contrato de venta a policía debía incluir cláusulas como:
- "No usar como única evidencia para arresto."
- "Siempre requerir verificación humana de match."
- "Reportar performance por subgrupo en deploy local antes de uso."
Microsoft eventualmente adoptó algo así. Las otras empresas no, hasta que la regulación lo forzó.
La lección estructural
Modelos con error rates desiguales por subgrupo demográfico, desplegados en high-stakes decisions, producen daño desproporcionado a los grupos peor servidos.
Esto se aplica a:
- Facial recognition (este caso).
- Speech recognition (peor en acentos no nativos).
- Medical imaging (peor en grupos sub-representados en training data).
- Credit scoring (cápsula 04).
- Cualquier modelo con accuracy global presentado sin desglose.
Accuracy promedio es engañoso. Subgroup analysis es no negociable cuando el sistema afecta a personas.
Trampas y errores comunes en interpretar este caso
1. "Es un problema de la industria, no de mi proyecto chico"
Falso. Cualquier proyecto que use modelos pre-entrenados (incluyendo APIs de OpenAI, Anthropic, Google) hereda sus biases. Si construís sobre esas APIs en un context de high-stakes, los biases son tu problema.
2. "La solución es solo más data"
Parcial. Más data ayuda, pero data balanceada importa más que más data. 10x más data desbalanceada no resuelve el problema; 1x data balanceada puede.
3. "Mi sistema no es high-stakes"
Definí high-stakes. Si tu sistema:
- Decide si una persona obtiene un préstamo, oferta, descuento, prioridad → high-stakes.
- Modera contenido de usuarios → high-stakes (false positives son censura).
- Recomienda contenido a millones de usuarios → high-stakes (escala efectos).
Pocos sistemas AI en producción son verdaderamente low-stakes. Asumí high-stakes y testeá adecuadamente.
4. "Si el accuracy global es alto, está bien"
El error principal del caso facial recognition. Accuracy global oculta gaps de subgrupo. Siempre desglosá.
Auto-verificación
1. ¿Por qué accuracy global del 95% no es suficiente?
Porque puede esconder distribución desigual. 95% global puede significar:
- 99% para grupo A (mayoritario).
- 70% para grupo B (minoritario).
Si grupo B representa 5% de la población pero 100% de los casos peor servidos, la experiencia del usuario individual del grupo B es 70% accuracy, no 95%.
Métricas correctas:
- Accuracy por subgrupo (race × gender × age, por ejemplo).
- Error rate ratio: peor / mejor. Si > 2x, hay bias estructural.
- False positive rate por subgrupo: especialmente importante en sistemas de verificación.
- False negative rate por subgrupo.
Reportá los cuatro o no reportes nada.
2. ¿Por qué los arrestos erróneos por facial recognition son siempre de personas negras?
Porque el sistema tiene error rate más alto para piel oscura. Mayor error rate → mayor probabilidad de falso match → mayor probabilidad de identificar erróneamente a alguien.
Si el sistema tiene:
- False positive rate 0.1% para piel clara.
- False positive rate 5% para piel oscura.
Cuando se corre contra una database de mugshots, una persona inocente con piel oscura tiene 50x más probabilidad de ser falsamente matcheada con un sospechoso real.
Es matemática, no intención. La intención no importa cuando el efecto es discriminatorio.
3. ¿Qué cambia cuando el sistema requiere "human verification" antes de actuar?
Mucho — pero no es solución completa.
Lo que mejora: si humano verifica match antes de arrestar, errores del modelo se filtran antes de tener consecuencia. En teoría, los falsos positivos no llegan al mundo físico.
Por qué no es solución completa:
- Automation bias: humanos tienden a confiar en outputs de máquinas, especialmente si no tienen información contradictoria. Si modelo dice "98% match", revisor humano probablemente acepta.
- Confirmation bias: el revisor humano sabe que el modelo dijo match → busca evidencia confirmatoria.
- Volumen: si revisor recibe 1,000 matches/día, no puede investigar cada uno cuidadosamente.
Solución más robusta: threshold alto de confidence + match limitado a leads, no a actionable evidence + entrenamiento explícito de revisores humanos sobre limitaciones del modelo.
4. ¿Por qué IBM abandonó facial recognition completamente?
Porque concluyeron que el riesgo reputacional + ético + legal supera el revenue. La línea de producto era pequeña en revenue para IBM, pero el daño a la marca por estar asociada con uso problemático en policing era grande.
Es una decisión de negocio razonable. Cuando los costos de externalidades superan los beneficios, abandonás la línea.
Esta lógica aplica a otros sistemas también. Antes de invertir en una línea AI, pregunta: ¿el potencial daño en mal uso supera el revenue probable? Si sí, no construyas.
Resumen y siguiente paso
- Gender Shades (2018) reveló error rates 30-40 puntos peores para mujeres negras en sistemas comerciales de facial recognition.
- Casos reales documentados de arrestos erróneos (Williams 2020, Parks 2019, Reid 2022, Woodruff 2023) — todos personas negras.
- Mecanismo: training data desbalanceada → modelo mejor en mayoritarios → testing global oculta gaps → deploy en high-stakes sin disaggregated metrics.
- Costo: humano (vidas trastornadas), financiero (IBM abandona producto, demandas, settlements), regulatorio (prohibiciones municipales, EU AI Act high-risk).
- Lección estructural: accuracy global engaña. Disaggregated testing por subgrupo es no negociable en sistemas que afectan a personas.
Checkpoint: deberías poder explicar por qué un sistema con 95% accuracy global puede ser claramente inaceptable cuando se desglosan los números.
Puente a la siguiente cápsula: la cápsula 04 cubre el tercer case study: Apple Card y credit scoring — cómo un sistema de scoring para una tarjeta de crédito generó denuncias públicas de discriminación de género (David Heinemeier Hansson, Steve Wozniak, otros), terminó en investigación de NY Department of Financial Services en 60 días, y demostró cómo proxies de género indirectos producen disparate impact incluso cuando el género no es feature explícita. El payoff técnico: cómo detectar proxy variables.
Recursos
- Gender Shades (Buolamwini & Gebru, 2018) — el paper original con resultados.
- Robert Williams ACLU case — primer arresto erróneo documentado.
- NIST FRVT — Face Recognition Vendor Test — benchmarking continuo.
- FairFace dataset (Karkkainen & Joo, 2021) — dataset balanceado open source.
- Joy Buolamwini — TED talk — context conceptual.
Siguiente: 04-case-study-credit-scoring.md — Apple Card y la discriminación vía proxies indirectos.
Cápsula 03 de 08 — Módulo 1 — AI Ethics & Compliance Guide