Retropropagación
Pase hacia delante
Primero se propaga la entrada por las capas hasta la predicción y se mide la pérdida. Ese valor es la semilla de todo: sin pérdida no hay nada que retropropagar.
Gradiente de la pérdida
Queremos saber cómo cambia la pérdida al mover un peso. Ese cambio es la derivada, y mover el peso en sentido opuesto a su derivada reduce la pérdida: es el descenso por gradiente.
Regla de la cadena
- La derivada de una composición es el producto de las derivadas de cada eslabón.
- Cada capa deriva su transformación y multiplica lo que le llega de la siguiente.
- Así la señal de error se encadena desde la salida hasta la primera capa.
Propagación hacia atrás
Se calculan primero los gradientes de la capa de salida y se van transmitiendo hacia atrás, reutilizando lo ya derivado. Una sola pasada hacia atrás entrega el gradiente de todos los pesos, barato comparado con estimarlos a finite differences.

Reutilizar el cálculo
El truco de eficiencia es que las derivadas intermedias se comparten: lo calculado en una capa alimenta a la anterior. Evita recalcular desde cero por cada peso, lo que haría la red prohibida.
Conexión con el desaparecimiento
Como el gradiente es un producto de muchas derivadas, si cada una es menor que uno el producto se apaga hacia atrás; si son mayores, explota. Esa es la raíz del desaparecimiento y la explosión del gradiente.
Autodiferenciación
Los frameworks construyen un grafo de operaciones y aplican la cadena automática, bien en modo cinta bien por compilación. El programador define el pase hacia delante; la máquina deriva sola hacia atrás.
Errores frecuentes
- Creer que la retropropagación aprende por ensayo y error perturbando pesos, cuando deriva de forma exacta con la cadena.
- Confundir el pase hacia delante con el entrenamiento: la red primero predice, y solo después se retropropaga.
- Olvidar que el gradiente es un producto de derivadas y que por eso puede apagarse o explotar con la profundidad.
Ejemplo resuelto: gradiente de un peso en la primera capa
Queremos saber cuánto mover un peso de la primera capa para reducir la pérdida final. Rastreamos su influencia hacia atrás:
- Avanzar la entrada por la red hasta la predicción y medir la pérdida.
- Derivar la pérdida respecto a la salida de la última capa.
- Multiplicar por la derivada de cada capa intermedia, de atrás hacia delante.
- Encadenar hasta llegar al peso de la primera capa.
- Mover el peso en sentido contrario a ese gradiente acumulado.
¿Para qué sirve en la realidad?
Sin retropropagación no habría redes profundas: es lo que vuelve barato calcular, en una sola pasada, hacia dónde mover millones de pesos a la vez.
La retropropagación calcula el gradiente de todos los pesos aplicando principalmente:
Retropropagar el gradiente es más eficiente que estimarlo perturbando cada peso uno a uno.
Backprop
Toca una tarjeta para ver la respuesta.
Ordena las fases de un paso de entrenamiento con retropropagación:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
RetropropagaciónDerivación y mecánica del algoritmo de retropropagación del gradiente.
Une cada término con su papel en el aprendizaje.
El error viaja hacia atrás
- Retropropagación
- Hacia delante
- propaga entrada
- propaga entrada
- mide pérdida
- Hacia delante
- producto de derivadas
- de salida a entrada
- gradiente se apaga
Retropropagación en la WikipediaFormulación del algoritmo y su relación con la regla de la cadena.
Tu red profunda deja de mejorar y las primeras capas casi no reciben gradiente. Desde la óptica del encadenamiento de derivadas, ¿qué fenómeno sospechas y qué dos remedios probarías?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.