← Lumbre

Ciencia de Datos e IA Capstone resuelto: el predictor de abandono, de la pregunta al despliegue

← Volver a todos los contenidos
Portada de Capstone resuelto: el predictor de abandono, de la pregunta al despliegue

Capstone resuelto: el predictor de abandono, de la pregunta al despliegue

✦ Capstone completo y resuelto de churn: pregunta con costos, EDA con hallazgos, limpieza anti-fuga, baseline batido, confusion en dolares, barrido de umbral con mejora del 41%, despliegue con drift y autoexamen · Ciencia de Datos e IA · y te lleva 8 minutos

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Integration de toda la carrera en un proyecto end-to-end con las siete etapas, metricas de negocio en dolares, umbral optimo, explicabilidad y despliegue monitoreado.

8 min 17–99 años
Autoevaluación
Más
Capstone resuelto: el predictor de abandono, de la pregunta al despliegue

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Capstone resuelto: el predictor de abandono, de la pregunta al despliegue

Este es el proyecto que ata TODA la carrera: un caso completo de abandono de clientes resuelto en siete etapas, con los numeros, las decisiones y los errores que se cometen de verdad. Cada etapa muestra su entregable concreto y el codigo que la ejecuta, citando el OA especifico donde se fundo la tecnica. Correr este capstone entero (una tarde con un dataset tuyo) es la mejor preparacion para una defensa de proyecto que cualquier rubrica.

Pipeline de proyecto de datos: siete etapas de la pregunta al despliegue con sus entregables.
Un pipeline no es solo codigo: cada etapa tiene una pregunta, un entregable y un criterio de paso a la siguiente.

Etapa 1 · La pregunta (la que nadie quiere trabajar)

Pedido vago: "queremos predecir churn". Buenas preguntas tienen cuatro componentes — decision, sujeto, horizonte y metrica: "Que clientes con suscripcion mensual cancelaran en los proximos 30 dias, para que el equipo de retencion les ofrezca una llamada ANTES, priorizando llamadas donde el costo de la llamada (3 USD) es menor que el margen recuperado (25 USD)". Ese numero de margenes NO es decoracion: define el umbral operativo de la etapa 6 y se acuerda CON el negocio en la etapa 1. Entregable: una pagina escrita y firmada: pregunta, metrica de exito, costos de error, limite temporal.

Etapa 2 · Datos y primera mirada

EDA de 20 minutos que cambia el proyecto

  1. Paso 1 · Panoramica

    Dataset: 10.000 filas de clientes (antiguedad_meses, uso_semanal, ticket_medio, soporte_llamadas, plan, churn). describe() y value_counts() primero: los extremos imposibles (antiguedad −3) se ven en la primera pasada si MIRAS.
    import pandas as pd
    df = pd.read_csv('clientes.csv')
    print(df.describe()); print(df['churn'].value_counts(normalize=True))

Paso 1 de 3

Etapa 3 · Limpieza con decision

Cuatro movidas, cuatro justificaciones

  1. Paso 1 · Faltantes

    Missing: media/mediana SOLO en numericos sin estructura; para soporte_llamadas, imputar por MEDIANA DENTRO de plan (agrupar primero) + flag was_missing: la ausencia informa.

Paso 1 de 4

Etapa 4 · Baseline y modelo

La humilde regresion logistica primero

  1. Paso 1 · Filosofia

    Por que baseline logistica y no XGBoost de inicio: porque sin el numero del modelo simple no sabras si la complejidad PAGA. Regla: si predecir la mayoria de clase ya da 0.78, el modelo complejo tiene que justificarlo en costo.

Paso 1 de 3

Etapa 5 · Metrica de NEGOCIO (el giro de timon)

Traducir la confusion a dolares

  1. Paso 1 · Precios

    Costos de la etapa 1: llamada de retencion 3 USD, margen recuperado por saved customer 25 USD. Cada churn NO detectado cuesta 25; cada falso positivo cuesta 3.

Paso 1 de 3

Etapa 6 · Mejora: modelo y umbral

Donde el trabajo fino paga

  1. Paso 1 · Curva costo-umbral

    Arbol de boosting con class_weight y barrido de umbral de decision sobre la probabilidad: al umbral 0.30, recall 0.80 y precision 0.49 — mas llamadas (136 FP, 408 USD) pero FN cae a 60 (1500 USD): costo total 1908, una rebaja del 41%.
    probas = gb.predict_proba(X_te)[:, 1]
    for t in [0.3, 0.4, 0.5, 0.6]:
        y = (probas >= t)
        print(t, costo_de(y, y_te))

Paso 1 de 3

Etapa 7 · Desplegar y no irse

  • Artefactos: modelo serializado + requirements.txt + version DVC/git del dataset exacto (el OA de Git te dice por que).
  • Servir: un microservicio Flask con /predict que reciba el perfil y devuelva probabilidad; el negocio consume la LISTA priorizada diaria, no el endpoint crudo.
  • Monitoreo: drift de entradas (KS o PSI por columna) y caida del recall real (el ground truth llega 30 dias despues): alertas antes del desastre silencioso.
  • Feedback loop: cada llamada de retencion registrada (salvo/perdido) alimenta la siguiente version con etiqueta real — el proyecto vive en ciclo, no termina en el informe.

El capstone en un vistazo

  • Churn end-to-end
    • Etapa 1
      • Pregunta con costos acordados
    • Etapas 2-3
      • EDA con decisiones etiquetadas
    • Etapas 4-5
      • Baseline batido y metrica en dolares
    • Etapas 6-7
      • Umbral optimo, SHAP, equidad
      • Servir, monitorear, realimentar

Autoexamen cronometrado (20 minutos)

Del baseline: confusion [[620,80],[120,180]]. Calcula el RECALL de churn (180 entre 300), en decimal.

Con costos 25 USD por FN y 3 USD por FP, el costo del estado baseline (120 FN, 80 FP) es de cuantos USD.

La clase mayoritaria da accuracy 0.78. Un modelo nuevo saca 0.79 y recall de churn 0.55. ¿Lo despliegas?

El escalado con z-score se ajusta (fit) sobre todo el dataset antes del split para aprovechar mas datos.

El de decision (p. ej. 0.30 en vez de 0.50) se elige minimizando el costo del negocio, no la accuracy.

Etapa con su entregable.

      Video de repaso

      Proyecto de ML end-to-end: video complementario
      Un proyecto completo ejecutado ante tus ojos, para comparar con el tuyo.

      Recorre tus ultimos 3 proyectos con las siete etapas: ¿en cual faltaron las etapas 1 (pregunta con costo) o 5 (metrica de negocio)? ¿Cual fue el numero que no preguntaste al negocio? Ese es el parrafo que mas impresionara en una defensa: "mi metrica de exito es X porque su costo es Y".

      Tu texto se guarda sólo en este dispositivo.

      Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

      Autoevaluación

      Comprueba lo que aprendiste

      2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

      Iniciar autoevaluación
      Más sobre esta lección

      Llegaste aquí desde otro camino. Puedes seguir aquí el tiempo que quieras.

      Volver a «Cuadernillo de problemas resueltos: probabilidad y distribuciones»

      Rutas vivas

      ¿Y ahora qué? Elige el camino por lo que necesitas

      No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

      Otra forma de comprenderlo

      ✦ Explorar el universo completo
      Explora temas relacionados

      Conceptos

      Comentarios

      Inicia sesión para comentar.

      Todavía no hay comentarios. Sé la primera persona en opinar.