← Lumbre

Aprendizaje Supervisado · 5.º Gradient Boosting

← Volver a todos los contenidos
Portada de Gradient Boosting

Gradient Boosting

✦ Si el bagging paraleliza árboles independientes, el boosting los encadena con memoria: cada nuevo árbol se especializa en corregir los errores de todos los previos · Aprendizaje Supervisado · Machine Learning · 9 minutos que valen la pena

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Explicar cómo el boosting gradiente combina árboles débiles en secuencia, cada uno ajustado a los residuales o al gradiente de la pérdida del conjunto anterior.

9 min 18–30 años
Autoevaluación
Más
Gradient Boosting

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Gradient Boosting

Gradient boosting a detalle: XGBoost
Vídeo en español que desgrana cómo una secuencia de árboles débiles va corrigiendo los errores del modelo acumulado.

Secuencial, no paralelo

Mientras el bagging entrena árboles independientes y los promedia, el boosting los construye de uno en uno: el árbol número cien solo existe para mejorar al conjunto de los noventa y nueve previos. Esa dependencia secuencial es su esencia y la razón de que no se pueda paralelizar igual.

Ajustar al residual

La intuición más simple: tras cada ronda se calcula el error restante —la diferencia entre el valor real y la predicción acumulada—, y el siguiente árbol se entrena para predecir ese error, no la variable original. Sumar sus aportaciones va afinando la solución.

Una escalera ascendente de árboles pequeños, cada uno un peldaño más alto, con una curva discontinua coral por encima que se acerca a los peldaños a cada paso.
El boosting como escalera: cada árbol es un peldaño que corrige el error del conjunto anterior, y la curva de error se va pegando a la solución a medida que se sube.

Del residual al gradiente

El truco general usa el gradiente de la función de pérdida respecto a las predicciones actuales como objetivo del nuevo árbol. Para el error cuadrático, ese gradiente coincide con el residual, pero la formulación gradient permite optimizar cualquier pérdida derivable: clasificación, ranking, cuantiles.

Árboles débiles

Contraintuitamente, cada árbol es pequeño y poco profundo: simples interacciones de dos o tres variables. La fuerza emerge de la acumulación paciente de cientos de correcciones modestas, no de árboles individualmente inteligentes.

La tasa de aprendizaje

Cada contribución se escala por un factor pequeño —la tasa— antes de sumarse. Pasos diminutos exigen más árboles pero generalizan mejor: frenar el ansia de cada árbol deja margen para que los siguientes compensen errores de unos con otros.

Early stopping

Entrenar demasiados árboles reemplaza el sesgo bajo por varianza alta: el modelo empieza a memorizar. Se vigila una validación y se corta cuando deja de mejorar. Con boosting, el número de árboles es el hiperparámetro más importante que afinar.

Submuestreo estocástico

Variantes como el boosting por histogramas remuestrean filas o columnas por árbol, como en el bosque. Añade descorrelación, acelera el entrenamiento y reduce el sobreajuste sin perder la lógica secuencial.

Errores frecuentes

  • Poner una tasa de aprendizaje alta con pocos árboles y esperar el rendimiento de una configuración lenta y paciente.
  • No reservar validación para el early stopping y entrenar hasta memorizar.
  • Descuidar el coste y la sensibilidad a hiperparámetros que exige un buen ajuste.

Ejemplo resuelto: batir el récord de una tabla

Un conjunto de datos tabular con variables heterogéneas y una métrica exigente. El protocolo:

  1. Empezar paciente: tasa de aprendizaje pequeña y muchos árboles, no al revés.
  2. Árboles débiles: profundidad dos o tres para capturar interacciones simples por ronda.
  3. Vigilar la validación: early stopping en cuanto deja de mejorar, antes de memorizar.
  4. Submuestrear: filas y columnas al azar por árbol para descorrelacionar y acelerar.
  5. Ajustar en rejilla: tasa, profundidad y número de árboles juntos, nunca de uno en uno.

¿Para qué sirve en la realidad?

Durante años ganó casi toda competición sobre datos tabulares: fraude, demanda, riesgo. Su receta —correcciones pequeñas y acumulativas— convierte cientos de aprendices mediocres en el modelo más preciso del repertorio clásico.

¿Qué aprende cada árbol nuevo en el boosting gradiente?

Reducir la tasa de aprendizaje suele exigir más árboles pero mejora la generalización.

Rey de las tablas

En datos tabulares con características heterogéneas, el boosting gradiente bien ajustado supera regresionalmente a bosques y redes. Su mezcla de flexibilidad no lineal, optimización directa de la pérdida y robustez práctica lo hizo durante años el por defecto serio.

Boosting

Entrenar árboles de uno en uno
secuencial
Objetivo del nuevo arbol
gradiente de la perdida
Arboles pequenos poco profundos
debiles
Factor que escala cada aportacion
tasa de aprendizaje
Cortar cuando la validacion deja de mejorar
early stopping

Toca una tarjeta para ver la respuesta.

Ordena una ronda de boosting gradiente:

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada pieza del boosting con su definición.

      Sumar correcciones

      • Gradient boosting
        • Lógica
          • secuencial
            • corregir al anterior
            • Objetivo
              • gradiente de la pérdida
                • residuales
                • Piezas
                  • árboles débiles
                    • tasa pequeña
                    • Frenos
                      • early stopping
                        • submuestreo

                      Subes el número de árboles sin parar y la pérdida en entrenamiento sigue bajando pero la de validación sube. ¿Qué fenómeno observas y qué dos palancas tocarías?

                      Tu texto se guarda sólo en este dispositivo.

                      Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                      Autoevaluación

                      Comprueba lo que aprendiste

                      2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                      Iniciar autoevaluación
                      Más sobre esta lección

                      Rutas vivas

                      ¿Y ahora qué? Elige el camino por lo que necesitas

                      No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                      Otra forma de comprenderlo

                      ✦ Explorar el universo completo
                      Explora temas relacionados

                      Conceptos

                      Comentarios

                      Inicia sesión para comentar.

                      Todavía no hay comentarios. Sé la primera persona en opinar.