Predicción de churn bancario con Machine Learning
Proyecto Final de Data Science de Ariana Nazarena Arroyo
Diplomatura en Ciencia de Datos con R y Python
¿Se puede anticipar qué clientes van a abandonar un banco antes de que lo hagan? La predicción de churn responde exactamente esa pregunta. En este artículo te contamos cómo nuestra estudiante Ariana Arroyo desarrolló su proyecto final de diplomatura: un modelo de Machine Learning que identifica a los clientes en riesgo de abandono y, además, calcula cuánto dinero le ahorraría al banco intervenir a tiempo.
¿Qué es la predicción de churn y por qué importa?
Las empresas que operan bajo modelos de suscripción o de servicios continuos, como los bancos, enfrentan un problema crítico: la pérdida de clientes. Retener a un cliente existente cuesta mucho menos que adquirir uno nuevo. Por eso, la predicción de churn se convirtió en una de las aplicaciones más demandadas de la ciencia de datos en la industria financiera.
En concreto, un modelo de churn permite tres cosas:
- Identificar a los clientes con mayor probabilidad de abandono.
- Diseñar campañas de retención focalizadas, en lugar de intervenciones masivas y costosas.
- Medir el beneficio económico esperado de cada acción comercial.
El dataset: 10.000 clientes de un banco
El proyecto utilizó el dataset público Bank Customer Churn de Kaggle, con 10.000 filas y 14 columnas. Cada fila representa un cliente y cada columna, una característica: score crediticio, país, género, edad, antigüedad, saldo en cuenta, cantidad de productos contratados, tenencia de tarjeta de crédito, actividad como miembro y salario estimado.
La variable objetivo es binaria: el valor 1 representa el abandono y el 0, la permanencia. El dataset presenta un desbalance moderado, ya que solo el 20 % de los clientes abandonó la entidad.
Análisis exploratorio: el perfil del cliente que abandona
Antes de modelar, Ariana investigó qué distingue a los clientes que se van. El análisis reveló varios patrones interesantes:
- Edad: los clientes que abandonan tienen, en promedio, 45 años; una edad mayor que la de quienes permanecen.
- Actividad: los miembros activos abandonan mucho menos que los inactivos.
- Cantidad de productos: contra la intuición, los clientes con más productos contratados muestran mayor tasa de abandono, posiblemente por el costo del paquete.
- País: los clientes de Alemania presentan la tasa de churn más alta (32,4 %).
Además, la matriz de correlación descartó problemas de multicolinealidad entre las variables predictoras.
Los modelos: de la regresión logística al Random Forest
Con los datos preprocesados (codificación de variables categóricas y escalado de características), se entrenaron y optimizaron tres algoritmos:
- Regresión logística
- Máquina de soporte vectorial (SVM)
- Random Forest
Sin embargo, lo más valioso del proyecto no fue la comparación técnica, sino la métrica elegida para decidir. En lugar de quedarse solo con el ROC-AUC, Ariana definió una métrica de beneficio esperado: la diferencia entre el dinero retenido gracias a la campaña y el costo total de intervenirla.
El modelo ganador y el umbral óptimo
El Random Forest resultó el mejor modelo en todas las dimensiones: mayor ROC-AUC, mayor precisión y mayor beneficio esperado. Luego, la optimización del umbral de decisión arrojó un valor óptimo de 0,41, que maximiza el beneficio de la campaña de retención.
Para validar la estabilidad del modelo, se aplicó bootstrap con 1.000 remuestreos. El resultado: un intervalo de confianza del 95 % para el ROC-AUC de entre 0,83 y 0,88. Un intervalo alto y estrecho, que indica una capacidad de discriminación consistente ante distintas muestras de entrenamiento y prueba.
Resultados: predicción de churn con impacto de negocio
El modelo final recomendó intervenir sobre 603 clientes. De esas intervenciones, más de la mitad serían exitosas, lo que genera un beneficio neto positivo para el banco. En consecuencia, la conclusión del proyecto es clara: integrar este modelo a los sistemas de la entidad permitiría hacer predicciones periódicas y apoyar las decisiones comerciales con evidencia.
Este tipo de trabajo demuestra algo que repetimos en cada cursada: un buen proyecto de ciencia de datos no termina en una métrica estadística, sino en una decisión de negocio cuantificada.