← Lumbre

Optimización · 7.º Optimización estocástica y para ML

← Volver a todos los contenidos
Portada de Optimización estocástica y para ML

Optimización estocástica y para ML

✦ Entrenar un modelo es optimizar una pérdida sobre datos · Optimización · Matemáticas · 5 minutos que valen la pena

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Conectar el descenso de gradiente, el mini-batch y la convexidad con el entrenamiento de modelos de aprendizaje automático.

5 min 18–30 años
Autoevaluación
Más
Optimización estocástica y para ML

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Optimización estocástica y para ML

Algoritmos de optimización para el aprendizaje
Vídeo en español sobre gradiente, convexidad, momento y métodos adaptativos como Adam.

La pérdida como objetivo

Un modelo define una función de pérdida que mide su error en los datos de entrenamiento. Entrenar es minimizar esa pérdida moviendo los parámetros: un problema de optimización puro.

Descenso de gradiente

Se calcula el gradiente de la pérdida y se restan los parámetros en su dirección opuesta, escalados por una tasa de aprendizaje. En un problema convexo, esto converge al óptimo global.

El coste del gradiente completo

Calcular el gradiente sobre todo el conjunto en cada paso es prohibitivo con millones de muestras. Ahí entra la idea estocástica: aproximar con una parte.

Descenso estocástico

  • Usa un solo ejemplo por paso para estimar el gradiente.
  • Muy barato y ruidoso, pero avanza sin esperar a todo el conjunto.
  • El ruido ayuda a escapar de óptimos locales superficiales.
Un cuenco teal visto en perspectiva con una trayectoria zigzagueante punteada en coral que baja en pasos desde el borde hasta el fondo, marcado con una estrella.
El descenso estocástico baja la pérdida a zancadas ruidosas: cada paso estima el gradiente con pocos datos.

Mini-batch

El compromiso dominante: estimar el gradiente con un subconjunto de muestras. Equilibra el ruido del ejemplo único y el coste del gradiente lleno, y aprovecha la vectorización de la GPU.

Tasa de aprendizaje

Es el tamaño del paso: demasiado grande oscila o diverge; demasiado pequeño tarda una eternidad. Quizá el hiperparámetro más delicado de todo el entrenamiento.

Momento

Acumula inercia de gradientes previos para suavizar el zigzag y acelerar en direcciones consistentes. Un paso barato que mejora mucho la convergencia.

Métodos adaptativos

Adam y similares ajustan una tasa por parámetro según el historial de sus gradientes, combinando momento y precondición diagonal. Convergen rápido con poca sintonización.

Paisaje no convexo

En redes profundas la pérdida no es convexa: hay mínimos locales y puntos de silla. Aun así, el descenso estocástico encuentra soluciones bastante buenas en la práctica.

Convergencia práctica

Se monitoriza la pérdida de validación y se decae la tasa o se para temprano. La teoría de convergencia guía, pero el criterio se decide con datos.

De la teoría a la trinchera

La convexidad da garantías que el deep learning rara vez tiene; aun así, sus ideas —gradiente, curvatura, dualidad— siguen explicando por qué y cuándo aprende un optimizador.

Errores frecuentes

  • Fijar una tasa de aprendizaje demasiado alta y ver oscilar la pérdida creyendo que el modelo está roto.
  • Confundir ruido del mini-batch con sobreajuste: la pérdida de entrenamiento tiembla, y es normal.
  • No tocar más hiperparámetros que la tasa, cuando momento y tamaño de lote también mueven la convergencia.

Ejemplo resuelto: un paso de entrenamiento

Quieres entender qué ocurre realmente en cada iteración de tu red:

  1. Muestreas un mini-batch aleatorio de 64 ejemplos.
  2. Calculas la predicción y la pérdida del lote hacia delante.
  3. Retropropagas para estimar el gradiente medio del lote.
  4. Adam combina momento y precondición para proponer el paso.
  5. Actualizas los pesos y monitorizas la pérdida de validación al cerrar cada época.

¿Para qué sirve en la realidad?

Sin descenso estocástico no habría aprendizaje profundo: es el motor que entrena con millones de ejemplos en horas. Elegir lote, tasa y optimizador decide si tu modelo aprende, se estanca o diverge.

El mini-batch en el entrenamiento de modelos es ante todo un compromiso entre:

En un problema estrictamente convexo y suave, el descenso de gradiente con tasa adecuada converge al mínimo global.

Estocástica

Función que mide el error del modelo y se minimiza
perdida
Dirección en que se mueven los parámetros para reducir la pérdida
gradiente
Tamaño del paso que hay que afinar con cuidado
tasa de aprendizaje
Estimar el gradiente con un subconjunto de ejemplos
mini-batch
Optimizador adaptativo con momento y precondición
adam

Toca una tarjeta para ver la respuesta.

Ordena un paso de entrenamiento con mini-batch:

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada ingrediente del optimizador con su función.

      Optimizar sobre datos

      • Optimización estocástica
        • Base
          • gradiente
            • tasa de aprendizaje
            • Estimacion
              • sgd ruidoso
                • mini-batch equilibrado
                • Mejoras
                  • momento
                    • adam adaptativo
                    • Practica
                      • early stopping
                        • decaer la tasa

                      Tu pérdida de entrenamiento baja pero la de validación sube. Desde la óptica de la optimización, ¿qué está pasando y qué palancas (tasa, batch, regularización) tocarías?

                      Tu texto se guarda sólo en este dispositivo.

                      Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                      Autoevaluación

                      Comprueba lo que aprendiste

                      2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                      Iniciar autoevaluación
                      Más sobre esta lección

                      Rutas vivas

                      ¿Y ahora qué? Elige el camino por lo que necesitas

                      No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                      Para profundizar

                      ✦ Explorar el universo completo
                      Explora temas relacionados

                      Conceptos

                      Comentarios

                      Inicia sesión para comentar.

                      Todavía no hay comentarios. Sé la primera persona en opinar.