Regresión regularizada
El problema de la libertad total
Una regresión lineal sin restricciones minimiza el error de entrenamiento como sea, incluso inflando coeficientes para explotar correlaciones espurias. Con muchas variables o con columnas casi redundantes, la solución se vuelve inestable y optimista. La regularización pone un freno.
La idea de penalizar
Se añade a la pérdida un término que crece con el tamaño de los coeficientes. Minimizar pasa a ser un equilibrio entre dos fuerzas: ajustar bien los datos y mantener los coeficientes pequeños. Un parámetro de fuerza decide cuánto peso tiene cada objetivo.
Ridge: penalización cuadrática
Ridge suma el cuadrado de los coeficientes —pena l2—. Como castiga sobre todo los valores grandes, encoge todos los coeficientes hacia cero sin anularlos ninguno. Estabiliza cuando las variables están correlacionadas, repartiendo el peso entre ellas en vez de volverse loco.
Lasso: penalización absoluta
Lasso usa el valor absoluto de los coeficientes —pena l1—. Su geometría empuja algunos coeficientes exactamente a cero, eliminando variables del modelo. Ese escaso resultado es oro para interpretar y para elegir predictores en mares de candidatos.
La geometría detrás
Ridge restringe la solución a un disco —suave, nunca toca los ejes—; lasso a un rombo con esquinas justo sobre los ejes, donde algún coeficiente se anula. Esa diferencia de forma explica por qué uno encoge y el otro selecciona, aunque ambos partan de la misma idea de limitar el tamaño.

Red elástica
Cuando hay grupos de variables correlacionadas que importan juntos, lasso elige una al azar del grupo y descarta el resto. La red elástica combina las dos penas: selecciona como lasso pero mantiene la cohesión de ridge ante predictores hermanados.
El parámetro lambda
La fuerza de la penalización —lambda— es el hiperparámetro central. Demasiada anula señales útiles y subajusta; poca deja el descontrol original. Se elige por validación cruzada, y con ella el grado de parsimonia del modelo final.
Escalado previo obligatorio
Penalizar el tamaño solo tiene sentido si todas las variables miden en escalas comparables: si no, la pena castiga injustamente a las de unidad pequeña. Estandarizar las columnas antes de aplicar ridge o lasso no es opcional, es un requisito para que la penalización haga lo que debe.
Errores frecuentes
- Regularizar sin estandarizar, dejando que la escala dicte qué coeficientes sobreviven.
- Elegir lambda mirando el ajuste en entrenamiento en vez de la validación.
- Interpretar un coeficiente anulado por lasso como prueba de irrelevancia causal de la variable.
Ejemplo resuelto: predecir consumo con cien predictores
Una distribuidora quiere estimar el consumo mensual de cada cliente a partir de casi cien variables muy correlacionadas entre sí. El procedimiento:
- Escalar: estandarizar todas las columnas para que la penalización trate a todas por igual.
- Elegir pena: arrancar con ridge si se sospecha que casi todo aporta; probar lasso si se cree que mandan unas pocas.
- Sintonizar lambda: barrer valores por validación cruzada y quedarse con el que mejor predice fuera de muestra.
- Comparar: mirar error de validación y cuántas variables sobreviven; lasso suele dejar una lista corta y legible.
- Validar: confirmar en un conjunto apartado que el modelo no persigue el ruido.
¿Para qué sirve en la realidad?
La regresión regularizada es el estándar cuando hay más candidatas que muestras o están muy correlacionadas: precios inmobiliarios, riesgo clínico, demanda energética. Ridge estabiliza pronósticos; lasso entrega modelos delgados que se pueden explicar a un negocio.
¿Qué distingue al lasso del ridge en el tratamiento de los coeficientes?
La regularización suele empeorar el ajuste en entrenamiento para mejorar la predicción en datos nuevos.
Cuándo usar cada uno
Con muchas variables y sospecha de que solo algunas importan, lasso y su selección vienen bien. Con predictores correlacionados que aportan en conjunto, ridge reparte el peso con más estabilidad. Ante la duda, la red elástica deja afinar la mezcla.
Regularización
Toca una tarjeta para ver la respuesta.
Ordena el flujo para ajustar un modelo regularizado:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Une cada pena o herramienta con su efecto.
Domar la complejidad
- Regresión regularizada
- Idea
- penalizar tamaño
- penalizar tamaño
- menos varianza
- Idea
- pena l2
- pena l1
- estandarizar
¿Qué es la regresión Ridge?Referencia en español sobre la penalización l2 y el control del sobreajuste.
Con dos mil candidatas y pocas relevantes, ridge te devuelve un modelo denso e ilegible. ¿Qué cambiarías y qué esperas observar en los coeficientes?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.