Redes recurrentes
El bucle de la recurrencia
En cada paso la red combina la entrada actual con el estado oculto previo y produce uno nuevo. El mismo conjunto de pesos se comparte a lo largo del tiempo, procesando secuencias de longitud variable.
Desplegar en el tiempo
- Una RNN puede verse como una red profunda con una capa por paso temporal.
- Los pesos se repiten en cada paso; el estado viaja de un eslabón al siguiente.
- La pérdida se acumula sobre todos los pasos de la secuencia.
El gradiente desapareciente
Al retropropagar por muchos pasos, el gradiente es un producto de derivadas repetidas; si son menores que uno, se apaga y la red no aprende dependencias largas. Con mayores que uno, explota.

La célula✦ LSTM
La LSTM añade un estado de celda que actúa como cinta transportadora, dejando fluir el gradiente sin multiplicarlo una y otra vez. Es la arquitectura que domó el desaparecimiento.
Las puertas de la LSTM
Tres puertas sigmoides deciden con qué fuerza pasar información: la de olvido descarta lo inútil, la de entrada escribe lo nuevo y la de salida publica el estado. Aprender a abrir y cerrar es la clave.
La puerta GRU
El GRU simplifica a dos puertas —actualización y reinicio— sin estado de celda separado. Más barato casi siempre rinde parecido, y se elige por comodidad y datos.
Bidireccionalidad
Leer la secuencia hacia delante y hacia detrás deja que cada palabra vea su contexto completo. Útil cuando el futuro ayuda a interpretar el pasado, como en tareas de etiquetado.
Hoy, transformers
El mecanismo de atención y los transformers han desplazado a las RNN en muchas tareas por su paralelización. Aun así, las recurrentes siguen donde el procesado en flujo continuo y la memoria ligera mandan.
Errores frecuentes
- Esperar que una RNN sencilla aprenda dependencias muy largas, cuando el gradiente se apaga al retropropagar en el tiempo.
- No enmascarar las longitudes variables al procesar lotes de secuencias de distinta duración.
- Creer que LSTM y GRU son intercambiables sin coste: el GRU es más barato y a veces rinde igual, otras no.
Ejemplo resuelto: predecir con una dependencia lejana
Una señal al principio de la frase determina el sentido al final, y la RNN sencilla no la recuerda. Analizamos por qué y qué hacer:
- Observar que la RNN sencilla retropropaga multiplicando derivadas en cada paso del tiempo.
- Notar que con muchos pasos el producto se apaga y la dependencia lejana no se aprende.
- Sustituir por una LSTM, cuyo estado de celda suma en vez de multiplicar.
- Dejar que la puerta de olvido mantenga abierta la información relevante durante muchos pasos.
- Verificar que ahora el gradiente fluye y la red asocia el inicio con el final.
¿Para qué sirve en la realidad?
Las secuencias están en todas partes —texto, audio, series de tiempo, sensores— y las recurrentes con puertas fueron durante años la herramienta que permitía aprender dependencias largas antes de la era de los transformers.
La principal dificultad de entrenar una RNN sencilla sobre secuencias largas es:
El estado de celda de la LSTM ayuda a que la información y el gradiente perduren a lo largo de muchos pasos.
RNN
Toca una tarjeta para ver la respuesta.
Ordena el paso a paso de una RNN con LSTM al procesar una secuencia:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
LSTMMecanismo de puertas de la memoria a largo plazo.
Une cada concepto con su idea.
Pensar en secuencias
- Redes recurrentes
- RNN
- pesos compartidos
- pesos compartidos
- gradiente se apaga
- RNN
- estado de celda
- dos puertas
- lee en dos sentidos
Qué es una RNN según IBMIntroducción a las redes recurrentes y su uso con datos secuenciales.
Tus predicciones dependen de un evento ocurrido al inicio de una secuencia muy larga y la red no lo capta. ¿Cambiarías de RNN sencilla a LSTM o GRU, y por qué las puertas ayudan aquí?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.