← Lumbre

Fundamentos de Machine Learning · 5.º Compromiso sesgo-varianza

← Volver a todos los contenidos
Portada de Compromiso sesgo-varianza

Compromiso sesgo-varianza

✦ Detrás de cada predicción errónea hay dos culpables distintos: equivocarse por rigidez (sesgo) y equivocarse por nerviosismo ante el azar (varianza) · Fundamentos de Machine Learning · Machine Learning · y te lleva 6 minutos

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Descomponer el error de predicción en sesgo, varianza y ruido irreducible, y usar esa descomposición para elegir complejidad, datos y técnicas de ensemble.

6 min 18–30 años
Autoevaluación
Más
Compromiso sesgo-varianza

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Compromiso sesgo-varianza

Compensación entre sesgo y varianza
Vídeo en español que explica el intercambio entre sesgo y varianza y por qué no se pueden minimizar ambas a la vez.

Las tres fuentes del error

  • Sesgo: el error que introduce suponer una forma demasiado simple para la realidad.
  • Varianza: el error que introduce que el modelo cambie mucho según qué muestra de entrenamiento toque.
  • Ruido irreducible: la variabilidad de la propia realidad que ningún modelo puede explicar.

Qué es el sesgo

Un modelo con alto sesgo subajusta: insiste en una estructura que no se corresponde con el mundo, y falla de forma sistemática y predecible. Sus predicciones se desvían siempre en la misma dirección, porque su hipótesis es demasiado rígida.

Qué es la varianza

Un modelo con alta varianza sobreajusta: entrena con muestras distintas y da soluciones muy diferentes, persiguiendo el azar de cada conjunto. Es inestable: acierta en promedio cerca de la verdad pero se dispersa enormemente alrededor de ella.

Cuatro dianas una junto a otra: tiros dispersos centrados, tiros agrupados fuera del centro, tiros dispersos y descentrados, y tiros agrupados en el centro.
Las cuatro combinaciones de sesgo y varianza como dardos: el sesgo desplaza el promedio de los tiros, la varianza los dispersa; el objetivo es agruparse en el centro.

El intercambio

Hacer el modelo más flexible baja el sesgo pero sube la varianza; hacerlo más rígido baja la varianza pero sube el sesgo. No se pueden minimizar ambas a la vez con una sola palanca: la complejidad es un balance, no un dial hacia la perfección.

El error irreducible

Hay un suelo que ninguna destreza elimina: el ruido genuino de los datos. Mide la varianza de la respuesta dada la misma entrada. Todo modelo, por bueno que sea, tropieza con ese techo; perseguirlo es sobreajustar el azar.

Dónde está el óptimo

El error total es suma de sesgo al cuadrado, varianza y ruido. Su mínimo no está en el modelo más simple ni en el más rico, sino en el punto donde bajar el sesgo empieza a costar más varianza de la que ahorra. Ese equilibrio es el objetivo del diseño.

Más datos bajan varianza

Aumentar el tamaño de la muestra no reduce el sesgo —la forma equivocada sigue equivocada—, pero sí estabiliza al modelo y baja su varianza, porque el ruido medio se cancela. Por eso el dato abundante doma a los modelos flexibles.

Los ensembles como doma

Promediar muchos modelos —bolsas, bosques aleatorios— ataca la varianza: los errores aleatorios individuales se cancelan entre sí y la predicción media se estabiliza. Combinar aprendices endebles flexibles da un conjunto menos variable sin aumentar el sesgo.

Sesgo y varianza en la práctica

Si el error en entrenamiento es alto, luchas contra el sesgo: necesitas un modelo más expresivo o mejores características. Si el hueco entre entrenamiento y validación es grande, luchas contra la varianza: más datos, regularización o ensembles. Cada síntoma apunta a su remedio.

Errores frecuentes

  • Creer que un modelo más complejo siempre será mejor por definición.
  • Buscar reducir el error por debajo del ruido irreducible, sobreajustando el azar.

Ejemplo resuelto: atacar la varianza con un ensemble

Un modelo muy flexible acierta en promedio pero cambia muchísimo con cada remuestreo. La intervención:

  1. Diagnosticar: error de entrenamiento bajo y brecha grande con validación apunta a varianza, no a sesgo.
  2. Elegir palanca: más datos o promediar modelos bajan la varianza; cambiar de familia atacaría el sesgo.
  3. Construir el ensemble: entrenar decenas de árboles sobre muestras distintas y votar o promediar.
  4. Medir de nuevo: la varianza debe caer sin que el sesgo suba de forma apreciable.
  5. Aceptar el suelo: si el error se acerca al ruido irreducible, detenerse; seguir es sobreajustar el azar.

¿Para qué sirve en la realidad?

Las competiciones y proyectos de datos se ganan diagnosticando el componente dominante del error: sabes si invertir en recolectar datos, en simpleza o en ensembles. Sin la descomposición, cada mejora se intenta a ciegas.

Al hacer un modelo más flexible, típicamente:

Añadir datos de entrenamiento reduce principalmente el sesgo del modelo.

La intuición de los dardos

Imagina lanzar dardos a un blanco muchas veces, cambiando de sala. El sesgo es cuán descentrado está tu promedio de tiros; la varianza, cuán dispersos caen. Puedes ser preciso pero inclinado (alta varianza), o centrado en promedio pero muy disperso. El maestro apunta a bajo sesgo y baja varianza a la vez, y eso exige entrenamiento.

Sesgo-varianza

Error por suponer una forma demasiado simple
sesgo
Error por sensibilidad a la muestra
varianza
Variabilidad que ningún modelo explica
ruido irreducible
Promediar modelos para estabilizar
ensemble
Suma de sesgo al cuadrado, varianza y ruido
error total

Toca una tarjeta para ver la respuesta.

Ordena la lectura diagnóstica del compromiso:

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada componente del error con su señal o su remedio.

      Descomponer el error

      • Sesgo y varianza
        • Sesgo
          • rigidez
            • falla en la misma dirección
            • Varianza
              • nerviosismo
                • cambia con la muestra
                • Ruido
                  • irreducible
                    • techo del error
                    • Remedios
                      • más flexibilidad
                        • más datos
                          • ensembles

                        Tu modelo gana al promediar diez versiones en bolsas. ¿Qué componente del error estás reduciendo, y por qué eso no arregla un modelo estructuralmente equivocado?

                        Tu texto se guarda sólo en este dispositivo.

                        Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                        Autoevaluación

                        Comprueba lo que aprendiste

                        2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                        Iniciar autoevaluación
                        Más sobre esta lección

                        Rutas vivas

                        ¿Y ahora qué? Elige el camino por lo que necesitas

                        No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                        Otra forma de comprenderlo

                        ✦ Explorar el universo completo
                        Explora temas relacionados

                        Conceptos

                        Comentarios

                        Inicia sesión para comentar.

                        Todavía no hay comentarios. Sé la primera persona en opinar.