Gradient Boosting
Secuencial, no paralelo
Mientras el bagging entrena árboles independientes y los promedia, el boosting los construye de uno en uno: el árbol número cien solo existe para mejorar al conjunto de los noventa y nueve previos. Esa dependencia secuencial es su esencia y la razón de que no se pueda paralelizar igual.
Ajustar al residual
La intuición más simple: tras cada ronda se calcula el error restante —la diferencia entre el valor real y la predicción acumulada—, y el siguiente árbol se entrena para predecir ese error, no la variable original. Sumar sus aportaciones va afinando la solución.

Del residual al gradiente
El truco general usa el gradiente de la función de pérdida respecto a las predicciones actuales como objetivo del nuevo árbol. Para el error cuadrático, ese gradiente coincide con el residual, pero la formulación gradient permite optimizar cualquier pérdida derivable: clasificación, ranking, cuantiles.
Árboles débiles
Contraintuitamente, cada árbol es pequeño y poco profundo: simples interacciones de dos o tres variables. La fuerza emerge de la acumulación paciente de cientos de correcciones modestas, no de árboles individualmente inteligentes.
La tasa de aprendizaje
Cada contribución se escala por un factor pequeño —la tasa— antes de sumarse. Pasos diminutos exigen más árboles pero generalizan mejor: frenar el ansia de cada árbol deja margen para que los siguientes compensen errores de unos con otros.
Early stopping
Entrenar demasiados árboles reemplaza el sesgo bajo por varianza alta: el modelo empieza a memorizar. Se vigila una validación y se corta cuando deja de mejorar. Con boosting, el número de árboles es el hiperparámetro más importante que afinar.
Submuestreo estocástico
Variantes como el boosting por histogramas remuestrean filas o columnas por árbol, como en el bosque. Añade descorrelación, acelera el entrenamiento y reduce el sobreajuste sin perder la lógica secuencial.
Errores frecuentes
- Poner una tasa de aprendizaje alta con pocos árboles y esperar el rendimiento de una configuración lenta y paciente.
- No reservar validación para el early stopping y entrenar hasta memorizar.
- Descuidar el coste y la sensibilidad a hiperparámetros que exige un buen ajuste.
Ejemplo resuelto: batir el récord de una tabla
Un conjunto de datos tabular con variables heterogéneas y una métrica exigente. El protocolo:
- Empezar paciente: tasa de aprendizaje pequeña y muchos árboles, no al revés.
- Árboles débiles: profundidad dos o tres para capturar interacciones simples por ronda.
- Vigilar la validación: early stopping en cuanto deja de mejorar, antes de memorizar.
- Submuestrear: filas y columnas al azar por árbol para descorrelacionar y acelerar.
- Ajustar en rejilla: tasa, profundidad y número de árboles juntos, nunca de uno en uno.
¿Para qué sirve en la realidad?
Durante años ganó casi toda competición sobre datos tabulares: fraude, demanda, riesgo. Su receta —correcciones pequeñas y acumulativas— convierte cientos de aprendices mediocres en el modelo más preciso del repertorio clásico.
¿Qué aprende cada árbol nuevo en el boosting gradiente?
Reducir la tasa de aprendizaje suele exigir más árboles pero mejora la generalización.
Rey de las tablas
En datos tabulares con características heterogéneas, el boosting gradiente bien ajustado supera regresionalmente a bosques y redes. Su mezcla de flexibilidad no lineal, optimización directa de la pérdida y robustez práctica lo hizo durante años el por defecto serio.
Boosting
Toca una tarjeta para ver la respuesta.
Ordena una ronda de boosting gradiente:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Une cada pieza del boosting con su definición.
Sumar correcciones
- Gradient boosting
- Lógica
- secuencial
- secuencial
- corregir al anterior
- Lógica
- gradiente de la pérdida
- árboles débiles
- early stopping
¿Qué es XGBoost?Explicación en español del gradient boosting aplicado y sus variantes.
Subes el número de árboles sin parar y la pérdida en entrenamiento sigue bajando pero la de validación sube. ¿Qué fenómeno observas y qué dos palancas tocarías?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.