← Lumbre

Fundamentos de Machine Learning · 5.º Descenso de gradiente

← Volver a todos los contenidos
Portada de Descenso de gradiente

Descenso de gradiente

✦ Casi todo modelo moderno se entrena con la misma idea primitiva: mirar cuesta abajo y dar un paso · Fundamentos de Machine Learning · Machine Learning · y te lleva 6 minutos

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Explicar cómo el descenso de gradiente ajusta parámetros moviéndose contra el gradiente de la pérdida, y comprender el papel de la tasa de aprendizaje y sus variantes.

6 min 18–30 años
Autoevaluación
Más
Descenso de gradiente

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Descenso de gradiente

Descenso de gradiente: cómo aprenden las redes neuronales
Capítulo en español de 3Blue1Brown que muestra visualmente cómo una red desciende por la superficie de pérdida ajustando sus parámetros.

La intuición de la pendiente

La pérdida es una superficie sobre los parámetros. En cada punto, el gradiente apunta en la dirección de mayor aumento. Para minimizar, nos movemos en la contraria: donde la pérdida crece menos, decrece más. Repetir pequeños pasos desciende hacia un mínimo.

La tasa de aprendizaje

Cada paso tiene un tamaño fijado por la tasa de aprendizaje. Demasiado pequeña: el descenso gatea y tarda eternamente. Demasiado grande: se salta el mínimo de un lado a otro, o se diverge hacia el infinito. Ajustarla es el primer hiperparámetro y uno de los más delicados.

Mínimos locales y silla de montar

En superficies complejas, el descenso puede quedar atrapado en un mínimo local que no es el global, o vagando cerca de puntos de silla. Sorprendentemente, en problemas de alta dimensión los mínimos locales razonables suelen bastar, y las sillas de montar se escapan con ayuda del momento.

Convexidad: el caso feliz

Cuando la pérdida es convexa —como la regresión lineal por mínimos cuadrados—, hay un único mínimo y el descenso, con pasos adecuados, siempre converge a él. La no convexidad de las redes es lo que hace el tema rico y a veces caprichoso.

Un mapa topográfico de anillos concéntricos con una trayectoria de puntos que desciende en pasos cada vez más pequeños hasta el centro y, a la derecha, dos perfiles laterales de un valle con pasos diminutos uno y enormes el otro.
El descenso visto desde arriba y desde el lado: cada paso va contra la pendiente; si es demasiado pequeño se gatea, si es demasiado grande se rebasa el fondo una y otra vez.

Descenso estocástico

Calcular el gradiente sobre todos los datos en cada paso es caro. El descenso estocástico usa un solo ejemplo —o un lote— y aun así desciende en promedio. Más ruidoso, pero muchísimo más rápido y con una ventaja oculta: el ruido ayuda a escapar de mínimos pobres.

Mini-lotes

El término medio es el mini-lote: un subconjunto pequeño de ejemplos por paso. Equilibra el coste y el ruido, aprovecha la computación vectorizada del hardware y es la forma estándar de entrenar modelos grandes hoy.

Momento

El momento añade inercia: en vez de ir solo según el gradiente actual, acumula una fracción de la dirección previa. Acelera en cañadas consistentes y amortigua el zigzag, cruzando valles estrechos que frenarían al descenso puro.

Tasas adaptativas

Métodos como adam ajustan una tasa distinta por parámetro según el historial de gradientes, y relajan la obsesión de afinar la tasa global. Han hecho del entrenamiento algo menos frágil, aunque la tasa sigue importando.

El precio del paso

Descender no garantiza el fondo: depende del punto de partida y del calendario de pasos. De ahí las estrategias de decrecimiento —empezar con pasos grandes y afinar— que ayudan a asentarse cerca del mínimo sin saltarlo.

Errores frecuentes

  • Poner una tasa de aprendizaje enorme y celebrar que la pérdida «explote» como si aprendiera.
  • Olvidar escalado previo de características, que deforma la superficie y enlentece el descenso.

Ejemplo resuelto: domar una tasa de aprendizaje que oscila

La pérdida cae rápido al principio y luego oscila sin asentarse. El protocolo:

  1. Leer la señal: oscilación alrededor de un nivel estable sugiere una tasa demasiado grande.
  2. Reducir la tasa global: pasos más cortos que dejen de saltar de lado a lado del mínimo.
  3. Verificar el escalado: características sin tipificar deforman la superficie y fingen mesetas.
  4. Añadir momento o un optimizador adaptativo para cruzar cañadas estrechas sin zigzaguear.
  5. Decrecer la tasa con la época: empezar con pasos amplios y afinar cerca del fondo.

¿Para qué sirve en la realidad?

Todo entrenamiento moderno es descenso de gradiente: saber leer sus curvas separa al que ajusta con criterio del que prueba hiperparámetros a ciegas. La mayoría de los entrenamientos que no arrancan son un problema de tasa o de escalado, no de arquitectura.

En el descenso de gradiente, ¿hacia dónde se actualizan los parámetros en cada paso?

Una tasa de aprendizaje demasiado grande siempre acelera el entrenamiento.

El ruido como aliado

Contraintuitamente, el carácter aproximado del descenso estocástico no es solo un compromiso de coste: su sacudida impide estancarse en soluciones mediocres y tiende a llevar a mínimos más planos, que generalizan mejor. El azar, bien dosificado, es parte del motor.

Gradiente

Dirección de mayor aumento de la pérdida
gradiente
Tamaño del paso del descenso
tasa de aprendizaje
Usa un ejemplo o lote por paso
descenso estocástico
Inercia que acumula direcciones previas
momento
Superficie con un solo mínimo
convexa

Toca una tarjeta para ver la respuesta.

Ordena el mecanismo de un paso de descenso de gradiente:

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada comportamiento del descenso con su causa o su remedio.

      Bajar al mínimo

      • Descenso de gradiente
        • Mecanismo
          • medir la pendiente
            • caminar contra ella
            • Hiperparámetros
              • tasa de aprendizaje
                • decrecimiento
                • Variantes
                  • estocástico
                    • mini-lotes
                      • adam
                      • Trampas
                        • zigzag
                          • mínimos locales
                            • no escalar

                          Tu pérdida baja muchísimo las primeras épocas y luego oscila sin estabilizarse. ¿Qué le dirías esto a la tasa de aprendizaje y qué ajuste probarías primero?

                          Tu texto se guarda sólo en este dispositivo.

                          Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                          Autoevaluación

                          Comprueba lo que aprendiste

                          2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                          Iniciar autoevaluación
                          Más sobre esta lección

                          Rutas vivas

                          ¿Y ahora qué? Elige el camino por lo que necesitas

                          No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                          Otra forma de comprenderlo

                          Para profundizar

                          ✦ Explorar el universo completo
                          Explora temas relacionados

                          Conceptos

                          Comentarios

                          Inicia sesión para comentar.

                          Todavía no hay comentarios. Sé la primera persona en opinar.