Optimización estocástica y para ML
La pérdida como objetivo
Un modelo define una función de pérdida que mide su error en los datos de entrenamiento. Entrenar es minimizar esa pérdida moviendo los parámetros: un problema de optimización puro.
Descenso de gradiente
Se calcula el gradiente de la pérdida y se restan los parámetros en su dirección opuesta, escalados por una tasa de aprendizaje. En un problema convexo, esto converge al óptimo global.
El coste del gradiente completo
Calcular el gradiente sobre todo el conjunto en cada paso es prohibitivo con millones de muestras. Ahí entra la idea estocástica: aproximar con una parte.
Descenso estocástico
- Usa un solo ejemplo por paso para estimar el gradiente.
- Muy barato y ruidoso, pero avanza sin esperar a todo el conjunto.
- El ruido ayuda a escapar de óptimos locales superficiales.

Mini-batch
El compromiso dominante: estimar el gradiente con un subconjunto de muestras. Equilibra el ruido del ejemplo único y el coste del gradiente lleno, y aprovecha la vectorización de la GPU.
Tasa de aprendizaje
Es el tamaño del paso: demasiado grande oscila o diverge; demasiado pequeño tarda una eternidad. Quizá el hiperparámetro más delicado de todo el entrenamiento.
Momento
Acumula inercia de gradientes previos para suavizar el zigzag y acelerar en direcciones consistentes. Un paso barato que mejora mucho la convergencia.
Métodos adaptativos
Adam y similares ajustan una tasa por parámetro según el historial de sus gradientes, combinando momento y precondición diagonal. Convergen rápido con poca sintonización.
Paisaje no convexo
En redes profundas la pérdida no es convexa: hay mínimos locales y puntos de silla. Aun así, el descenso estocástico encuentra soluciones bastante buenas en la práctica.
Convergencia práctica
Se monitoriza la pérdida de validación y se decae la tasa o se para temprano. La teoría de convergencia guía, pero el criterio se decide con datos.
De la teoría a la trinchera
La convexidad da garantías que el deep learning rara vez tiene; aun así, sus ideas —gradiente, curvatura, dualidad— siguen explicando por qué y cuándo aprende un optimizador.
Errores frecuentes
- Fijar una tasa de aprendizaje demasiado alta y ver oscilar la pérdida creyendo que el modelo está roto.
- Confundir ruido del mini-batch con sobreajuste: la pérdida de entrenamiento tiembla, y es normal.
- No tocar más hiperparámetros que la tasa, cuando momento y tamaño de lote también mueven la convergencia.
Ejemplo resuelto: un paso de entrenamiento
Quieres entender qué ocurre realmente en cada iteración de tu red:
- Muestreas un mini-batch aleatorio de 64 ejemplos.
- Calculas la predicción y la pérdida del lote hacia delante.
- Retropropagas para estimar el gradiente medio del lote.
- Adam combina momento y precondición para proponer el paso.
- Actualizas los pesos y monitorizas la pérdida de validación al cerrar cada época.
¿Para qué sirve en la realidad?
Sin descenso estocástico no habría aprendizaje profundo: es el motor que entrena con millones de ejemplos en horas. Elegir lote, tasa y optimizador decide si tu modelo aprende, se estanca o diverge.
El mini-batch en el entrenamiento de modelos es ante todo un compromiso entre:
En un problema estrictamente convexo y suave, el descenso de gradiente con tasa adecuada converge al mínimo global.
Estocástica
Toca una tarjeta para ver la respuesta.
Ordena un paso de entrenamiento con mini-batch:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Descenso de gradiente estocásticoOptimización iterativa con gradientes estimados.
Une cada ingrediente del optimizador con su función.
Optimizar sobre datos
- Optimización estocástica
- Base
- gradiente
- gradiente
- tasa de aprendizaje
- Base
- sgd ruidoso
- momento
- early stopping
AdamEl optimizador adaptativo que combina momento y precondición diagonal.
Tu pérdida de entrenamiento baja pero la de validación sube. Desde la óptica de la optimización, ¿qué está pasando y qué palancas (tasa, batch, regularización) tocarías?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.