Fuga de datos y optimismo
Qué es la fuga
Hay fuga cuando una característica contiene información del objetivo que no estaría disponible en el momento de predecir. El modelo la aprende y la usa, logrando una puntería que no podrá repetir fuera del laboratorio, donde esa señal ya no existe.

Por qué es tan peligrosa
A diferencia de otros fallos, la fuga no se manifiesta como un error evidente: al contrario, mejora las métricas. Cuanto mejor parece ir, más se confía el equipo y más tarde se descubre el engaño, normalmente ya desplegado.
Fuga por el objetivo
El caso más flagrante: una columna derivada de la propia etiqueta. Predecir si un cliente canceló usando el campo «número de llamadas de cancelación», que solo se llena cuando ya canceló. Es leer la respuesta en el enunciado.
Proxies e identificaciones
A veces una columna inocente es un disfraz del objetivo: un identificador que ordena por fecha de alta, un código postal que filtra una subpoblación. El modelo caza esos atajos y parecen predictores milagrosos que en realidad son pistas robadas.
Estadísticas contaminadas
Imputar con la media global o escalar con la desviación de todo el conjunto antes de dividir mete información de validación en entrenamiento. Cada estadística debe aprenderse solo con el entrenamiento de cada pliegue, como obliga un buen pipeline.
Viaje en el tiempo
En series temporales, usar el valor de mañana para predecir hoy es fuga temporal. También agregar sobre una ventana que incluye el futuro. La regla de oro: toda la información de una predicción debe ser anterior al instante que se predice.
Duplicados y solapamientos
El mismo caso, o una versión casi idéntica, aparece en entrenamiento y en prueba. El modelo lo memoriza y lo «predice» al reconocerlo. Agrupar por entidad —un paciente, un cliente— al dividir evita este disfraz de maestría.
Detectar lo demasiado bueno
Las señales de alarma: métricas que se disparan sin explicación, una característica que domina la importancia, un rendimiento que cae en picado al probarlo con datos de otro periodo. Desconfiar del éxito es virtud en este oficio.
Errores frecuentes
- Calcular transformaciones o imputaciones sobre todo el conjunto antes de la división.
- Incluir columnas generadas después del evento que se quiere anticipar.
- Aceptar una métrica excelente sin interrogar de dónde sale.
Ejemplo resuelto: cazar una fuga en un modelo de cancelación
Un banco predice qué clientes se irán y obtiene una exactitud sospechosamente alta. La auditoría:
- Revisar las columnas más importantes en busca de derivadas del propio evento de cancelación.
- Comprobar si alguna imputación o escalado usó la media de todo el conjunto y no solo del entrenamiento.
- Detectar identificadores o códigos postales que actúan como proxies disfrazados de la etiqueta.
- Recalcular las estadísticas dentro de un pipeline que aprende de cada pliegue por separado.
- Validar con datos de un periodo posterior: si el rendimiento se hunde, había fuga.
¿Para qué sirve en la realidad?
En banca, salud o mantenimiento predictivo una fuga no detectada despliega modelos inútiles que deciden mal con aire de certeza. Auditar el flujo —dividir primero, aprender solo del entrenamiento, probar en tiempo futuro— evita costosos engaños antes de llegar a producción.
¿Cuál es el síntoma clásico de que un modelo sufre fuga de información?
Escalar las características con la media y desviación de todo el conjunto antes de la validación cruzada constituye una forma de fuga.
El flujo correcto
Dividir primero, y solo después calcular cualquier estadística mirando exclusivamente el entrenamiento. Un pipeline que reaprende cada paso dentro de la validación cruzada blinda contra la fuga más tonta. La disciplina del orden lo previene casi todo.
Fuga
Toca una tarjeta para ver la respuesta.
Ordena el flujo libre de fuga:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Une cada tipo de fuga con cómo se manifiesta.
Por qué brilla en validación y falla fuera
- Fuga de datos
- Origen
- columna del objetivo
- columna del objetivo
- proxies
- Origen
- duplicados
- estadísticas con todo
- métrica demasiado buena
- dividir primero
Tu clasificador llega a una exactitud del noventa y nueve por ciento y una variable concentra casi toda la importancia. ¿Qué sospechas y cómo la comprobarías?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.