Seguridad

Sesgo de IA

Sesgo de IA se refiere a patrones sistemáticos y sesgados en las salidas de un sistema de IA que surgen de datos de entrenamiento sesgados, encuadre de problemas defectuoso, o elecciones de diseño del modelo, causando que el sistema trate individuos o grupos de manera inequitativa.

Sesgo de IA describe cualquier error consistente y no aleatorio en las predicciones o decisiones de un modelo que se correlaciona con atributos sensibles como raza, género, edad, religión, o estado socioeconómico. Abarca tanto sesgo estadístico—donde la predicción promedio de un modelo se desvía del valor verdadero—como sesgo social, donde esos errores se distribuyen desigualmente entre grupos demográficos, frecuentemente en detrimento de poblaciones históricamente marginalizadas.

El sesgo entra en sistemas de IA a través de múltiples caminos. Los datos de entrenamiento pueden subrepresentar ciertos grupos (un conjunto de datos de reconocimiento facial compuesto principalmente de caras de piel clara generalizará mal a sujetos de piel más oscura), reflejar discriminación histórica (un modelo de contratación entrenado en décadas de decisiones de aprobación dominadas por hombres codificará esos patrones como señal), o llevar sesgo de anotación donde los etiquetadores humanos aplican estándares inconsistentes entre grupos demográficos. La arquitectura del modelo y la función objetivo también juegan un papel: un sistema que optimiza la precisión promedio puede sacrificar el rendimiento en subgrupos minoritarios para mejorar las métricas generales, una compensación invisible en puntuaciones de referencia agregadas.

Las consecuencias prácticas son significativas. Un estudio de 2018 de Joy Buolamwini y Timnit Gebru encontró que los sistemas comerciales de clasificación de género tenían tasas de error hasta 34 puntos porcentuales más altas para mujeres de piel oscura que para hombres de piel clara. Las salidas sesgadas en puntuación de crédito, diagnóstico médico, evaluación de riesgo criminal, y contratación automatizada tienen efectos medibles en el acceso de las personas a préstamos, tratamiento, libertad y empleo. Los marcos regulatorios incluyendo la Ley de IA de la UE, con requisitos de sistema de alto riesgo aplicables a partir de 2024, exigen evaluaciones de sesgo y supervisión humana antes de la implementación.

A partir de 2026, la mitigación de sesgo abarca pre-procesamiento (curación de conjuntos de datos, remuestreo, aumento de datos sintéticos), en-procesamiento (restricciones de equidad durante el entrenamiento, desesgado adversarial), y post-procesamiento (ajuste de umbral por grupo demográfico). Ninguna técnica única elimina todas las formas de sesgo simultáneamente porque diferentes definiciones formales de equidad—probabilidades equalizadas, paridad demográfica, y paridad predictiva—son matemáticamente incompatibles cuando las tasas base difieren entre grupos. Los estándares de documentación tales como Model Cards y Datasheets for Datasets, junto con requisitos de auditoría de terceros cada vez más codificados en la ley, buscan institucionalizar la responsabilidad.

Ejemplo

Se descubrió que el modelo de aprobación de préstamos de un banco, entrenado en datos históricos, denegaba solicitudes de prestatarios calificados en ciertos códigos postales a tasas significativamente más altas que para prestatarios comparables en otros lugares, un patrón que una auditoría externa atribuyó al redlining histórico codificado en las características geográficas que el modelo había aprendido a ponderar fuertemente.

Términos relacionados

← Glosario