Regularización en profundidad
El sobreajuste profundo
Con millones de parámetros, la red tiene capacidad de sobra para memorizar el entrenamiento y flaquear en datos nuevos. Cuanto más expresiva, más hace falta contenerla para que generalice.
Dropout
- Apaga aleatoriamente neuronas en cada paso del entrenamiento.
- Evita que unidades específicas dominen y fomenta representaciones redundantes y robustas.
- En inferencia se usan todas, escalando adecuadamente las activaciones.
Como ensemble implícito
Al variar qué subred se entrena en cada paso, dropout imita un promedio de muchas redes. Ese ensemble de bolsillo reduce varianza y desanima la coadaptación de neuronas.

Penalización de pesos
Weight decay añade a la pérdida una pena por pesos grandes, empujando hacia modelos más simples y suaves. Es la regularización l2 clásica, hoy a menudo integrada en el propio optimizador.
Parada temprana
Monitorizar la pérdida de validación y detenerse cuando deja de mejorar corta el entrenamiento antes de que la red memorice ruido. Es barato y eficaz, aunque sensible al momento elegido.
Aumento de datos
Generar variantes de las entradas —giros, recortes, ruido— ensancha el conjunto sin etiquetar más. Obliga a la red a ser invariante a transformaciones irrelevantes y suele batir a otras regularizaciones.
Combinar frenos
Dropout, weight decay, aumento y parada temprana se suman y a veces se solapan. Usarlos todos a tope puede infra-ajustar; se gradúan según la brecha entre entrenamiento y validación.
Errores frecuentes
- Mantener dropout activo en inferencia, cuando ahí se usan todas las neuronas con el escalado adecuado.
- Aplicar todos los frenos a tope a la vez y caer en infraajuste, con la red incapaz de aprender siquiera el entrenamiento.
- Regularizar sin mirar la brecha entre entrenamiento y validación, ajustando el freno a ciegas.
Ejemplo resuelto: cerrar la brecha entre entrenamiento y validación
La red marca error casi nulo en entrenamiento pero se estanca en validación: sobreajuste típico. Combinamos frenos:
- Diagnosticar la brecha entre la métrica de entrenamiento y la de validación.
- Añadir dropout en las capas densas para impedir que confíe en neuronas concretas.
- Sumar weight decay para penalizar pesos grandes y modelos demasiado complejos.
- Ampliar datos con aumento si hay margen para generar variantes.
- Detener por parada temprana justo cuando la validación deja de mejorar.
¿Para qué sirve en la realidad?
Un modelo que memoriza es inútil en producción; la regularización es lo que convierte capacidad bruta en generalización, y se gradúa observando la brecha entre entrenar y validar.
El dropout reduce el sobreajuste principalmente porque:
Durante la inferencia, el dropout se mantiene activo apagando neuronas al azar igual que en entrenamiento.
Regularización
Toca una tarjeta para ver la respuesta.
Ordena la decisión ante una red que sobreajusta:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
RegularizaciónFamilias de técnicas que penalizan la complejidad para mejorar la generalización.
Une cada técnica con su efecto.
Aprender sin apoyarse en una sola neurona
- Regularización profunda
- Dropout
- apaga neuronas
- apaga neuronas
- ensemble implícito
- Dropout
- penaliza tamaño
- vigila validación
- más variantes
DropoutEl mecanismo de apagar neuronas al azar y su efecto regularizador.
Tu red llega a casi cero de error en entrenamiento pero estancada en validación. ¿Qué combinarías para cerrar esa brecha, y qué señal te diría que ya estás regularizando de más?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.