Descenso de gradiente
La intuición de la pendiente
La pérdida es una superficie sobre los parámetros. En cada punto, el gradiente apunta en la dirección de mayor aumento. Para minimizar, nos movemos en la contraria: donde la pérdida crece menos, decrece más. Repetir pequeños pasos desciende hacia un mínimo.
La tasa de aprendizaje
Cada paso tiene un tamaño fijado por la tasa de aprendizaje. Demasiado pequeña: el descenso gatea y tarda eternamente. Demasiado grande: se salta el mínimo de un lado a otro, o se diverge hacia el infinito. Ajustarla es el primer hiperparámetro y uno de los más delicados.
Mínimos locales y silla de montar
En superficies complejas, el descenso puede quedar atrapado en un mínimo local que no es el global, o vagando cerca de puntos de silla. Sorprendentemente, en problemas de alta dimensión los mínimos locales razonables suelen bastar, y las sillas de montar se escapan con ayuda del momento.
Convexidad: el caso feliz
Cuando la pérdida es convexa —como la regresión lineal por mínimos cuadrados—, hay un único mínimo y el descenso, con pasos adecuados, siempre converge a él. La no convexidad de las redes es lo que hace el tema rico y a veces caprichoso.

Descenso estocástico
Calcular el gradiente sobre todos los datos en cada paso es caro. El descenso estocástico usa un solo ejemplo —o un lote— y aun así desciende en promedio. Más ruidoso, pero muchísimo más rápido y con una ventaja oculta: el ruido ayuda a escapar de mínimos pobres.
Mini-lotes
El término medio es el mini-lote: un subconjunto pequeño de ejemplos por paso. Equilibra el coste y el ruido, aprovecha la computación vectorizada del hardware y es la forma estándar de entrenar modelos grandes hoy.
Momento
El momento añade inercia: en vez de ir solo según el gradiente actual, acumula una fracción de la dirección previa. Acelera en cañadas consistentes y amortigua el zigzag, cruzando valles estrechos que frenarían al descenso puro.
Tasas adaptativas
Métodos como adam ajustan una tasa distinta por parámetro según el historial de gradientes, y relajan la obsesión de afinar la tasa global. Han hecho del entrenamiento algo menos frágil, aunque la tasa sigue importando.
El precio del paso
Descender no garantiza el fondo: depende del punto de partida y del calendario de pasos. De ahí las estrategias de decrecimiento —empezar con pasos grandes y afinar— que ayudan a asentarse cerca del mínimo sin saltarlo.
Errores frecuentes
- Poner una tasa de aprendizaje enorme y celebrar que la pérdida «explote» como si aprendiera.
- Olvidar escalado previo de características, que deforma la superficie y enlentece el descenso.
Ejemplo resuelto: domar una tasa de aprendizaje que oscila
La pérdida cae rápido al principio y luego oscila sin asentarse. El protocolo:
- Leer la señal: oscilación alrededor de un nivel estable sugiere una tasa demasiado grande.
- Reducir la tasa global: pasos más cortos que dejen de saltar de lado a lado del mínimo.
- Verificar el escalado: características sin tipificar deforman la superficie y fingen mesetas.
- Añadir momento o un optimizador adaptativo para cruzar cañadas estrechas sin zigzaguear.
- Decrecer la tasa con la época: empezar con pasos amplios y afinar cerca del fondo.
¿Para qué sirve en la realidad?
Todo entrenamiento moderno es descenso de gradiente: saber leer sus curvas separa al que ajusta con criterio del que prueba hiperparámetros a ciegas. La mayoría de los entrenamientos que no arrancan son un problema de tasa o de escalado, no de arquitectura.
En el descenso de gradiente, ¿hacia dónde se actualizan los parámetros en cada paso?
Una tasa de aprendizaje demasiado grande siempre acelera el entrenamiento.
El ruido como aliado
Contraintuitamente, el carácter aproximado del descenso estocástico no es solo un compromiso de coste: su sacudida impide estancarse en soluciones mediocres y tiende a llevar a mínimos más planos, que generalizan mejor. El azar, bien dosificado, es parte del motor.
Gradiente
Toca una tarjeta para ver la respuesta.
Ordena el mecanismo de un paso de descenso de gradiente:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
An overview of gradient descentGuía de referencia sobre variantes del descenso de gradiente y optimizadores.
Une cada comportamiento del descenso con su causa o su remedio.
Bajar al mínimo
- Descenso de gradiente
- Mecanismo
- medir la pendiente
- medir la pendiente
- caminar contra ella
- Mecanismo
- tasa de aprendizaje
- estocástico
- zigzag
Descenso del gradienteReferencia en español sobre el algoritmo y su base matemática.
Tu pérdida baja muchísimo las primeras épocas y luego oscila sin estabilizarse. ¿Qué le dirías esto a la tasa de aprendizaje y qué ajuste probarías primero?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.