Redes multicapa
De una neurona a una capa
Una capa oculta agrupa muchas neuronas que cada una traza su propio hiperplano. La capa siguiente combina esas salidas, y la superposición de planos con no linealidad permite recortar regiones complejas.
Capas y composición
- Cada capa transforma su entrada y añade un nivel de abstracción.
- La profundidad compone funciones simples en representaciones jerárquicas.
- La anchura pone más neuronas por capa; la profundidad, más estadios de procesamiento.
Ancho frente a hondo
Una capa muy ancha puede teóricamente imitar a una profunda, pero a menudo exige muchas más parametrizaciones. La profundidad logra con pocas neuronas por capa composiciones que al ancho le cuestan una explosión.

El teorema y sus límites
El resultado garantiza existencia, no aprendizaje: una red puede existir que aproxime bien y aun así ser inencontrable por descenso de gradiente, o necesitar una anchura irreal. Teoría y optimización son batallas distintas.
Qué aprende cada capa
En visión, capas tempranas detectan bordes; las intermedias, texturas y partes; las finales, objetos. La jerarquía emerge sin que nadie la programe, fruto de la composición de no linealidades.
Dimensionar la red
Elegir profundidad y anchura es un equilibrio: demasiado grande sobreajusta y es caro; demasiado pequeño no representa la tarea. Se empieza simple y se crece con evidencia de validación.
Regular el poder
Cuanto más expresiva la red, más fácil memoriza el ruido. Por eso el poder de aproximación se casa con regularización y validación para que la capacidad se gaste en señal, no en sobreajuste.
Errores frecuentes
- Confundir poder expresivo con facilidad de aprendizaje: que exista la red no significa que el gradiente la encuentre.
- Añadir capas y neuronas sin más y acabar memorizando el ruido por sobreajuste.
- Creer que una capa muy ancha siempre sustituye a una profunda, cuando a menudo exige muchísimos más parámetros.
Ejemplo resuelto: dibujar dos medias lunas con un MLP
Dos clases en forma de medias lunas entrelazadas no son separables por una recta. Veamos cómo una red con capas ocultas sí las separa:
- Alimentar la red con las coordenadas de cada punto en la entrada.
- Pasar por una capa oculta con ReLU, que combina muchas rectas en regiones no lineales.
- Apilar una segunda capa que recombina esas regiones en formas curvas.
- Entrenar con la etiqueta de clase y retropropagar el error.
- Ver emerger una frontera curva que abraza cada media luna, algo imposible para una neurona suelta.
¿Para qué sirve en la realidad?
El teorema dice que la red puede, pero el diseño —profundidad, anchura, regularización— decide si de verdad aprende. Dimensionar bien es la diferencia entre un modelo que generaliza y uno que memoriza.
El teorema de aproximación universal afirma que una red con una capa oculta ancha puede aproximar cualquier función continua, pero NO garantiza que:
Añadir profundidad a una red nunca puede reemplazar a una capa extremadamente ancha.
MLP
Toca una tarjeta para ver la respuesta.
Ordena la lógica de construir un MLP desde cero:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Teorema de aproximación universalEnunciado y alcance de la capacidad de una red de una capa oculta.
Une cada concepto con su idea.
Poder expresivo no es facilidad
- Redes multicapa
- Capas ocultas
- muchos hiperplanos
- muchos hiperplanos
- regiones no lineales
- Capas ocultas
- composición jerárquica
- garantiza existencia
- capacidad de sobra
Perceptrón multicapaEstructura de capas y propagación de un perceptrón multicapa.
Tienes un problema con pocas muestras pero estructura jerárquica. ¿Optarías por red ancha poco profunda o honda y estrecha? Justifica por poder, coste y riesgo de sobreajuste.
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.