← Lumbre

Transformers y Modelos de Atención · 8.º Autoatención multi-cabeza

← Volver a todos los contenidos
Portada de Autoatención multi-cabeza

Autoatención multi-cabeza

✦ En la autoatención, consulta, clave y valor salen de la misma secuencia, de modo que cada token mira a todos los demás · Transformers y Modelos de Atención · Inteligencia Artificial · en 5 minutos

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Aplicar la autoatención y la atención multi-cabeza para modelar relaciones dentro de una misma secuencia, entendiendo su coste cuadrático.

5 min 18–30 años
Autoevaluación
Más
Autoatención multi-cabeza

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Autoatención multi-cabeza

Autoatención y cabezas múltiples
Vídeo en español que muestra cómo cada token de una secuencia consulta a todos los demás en paralelo.

Auto: Q, K y V de la misma fuente

En la autoatención, consulta, claves y valores provienen de la misma secuencia de entradas. Cada posición se consulta a sí misma y a las demás, capturando dependencias internas.

Proyecciones aprendidas

  • Tres matrices lineales distintas generan Q, K y V desde las mismas representaciones.
  • Esas proyecciones son lo que se entrena, no los pesos de atención explícitos.
  • Sin ellas, Q e K serían idénticos y la atención perdería expresividad.

Varias cabezas en paralelo

La atención multi-cabeza divide la dimensión en varias «cabezas», cada una con sus proyecciones. Cada cabeza aprende a atender a un tipo de relación distinto.

Subespacios de representación

Cada cabeza proyecta a un subespacio de menor dimensión y realiza su propia atención. Luego se concatenan las salidas y se mezclan con una proyección final.

Qué ganan las cabezas

Una cabeza puede ocuparse de la sintaxis, otra de referencias entre palabras, otra de proximidad local. Repartir el trabajo mejora la riqueza contextual.

Un abanico de pequeñas rejillas cuadradas teal, cada una con un patrón distinto de celdas coral resaltadas, que se recolocan en una sola columna ancha.
Cada cabeza aprende su propio mapa de relaciones; al concatenarse, la representación combina sintaxis, referencia y proximidad.

Coste cuadrático

La matriz de afinidades QK elevado a T tiene tamaño longitud por longitud. Duplicar la longitud cuadruplica el cómputo y la memoria: el gran cuello de botella de los transformers.

Paralelismo frente a recurrencia

  • La atención procesa todos los tokens a la vez, sin cadenas secuenciales.
  • Eso explota la GPU mejor que el paso a paso de una recurrente.
  • El precio es la complejidad cuadrática en la longitud.

Máscara causal

En generación se enmascara el futuro: cada posición solo puede mirar a las anteriores. Así el modelo no hace trampa leyendo lo que debe predecir.

Residual y normalización

La salida de atención se suma a la entrada (conexión residual) y se normaliza. Esto estabiliza redes muy apiladas y facilita el flujo del gradiente.

Cabezas y dimensiones

Más cabezas no siempre es mejor: cada una tendrá menos dimensión. Se busca un equilibrio entre número de cabezas y anchura por cabeza.

Errores frecuentes

  • Creer que más cabezas son gratis: cada cabeza padece menos dimensión y el coste total no baja.
  • Generar sin máscara causal y que el modelo entrene viendo el futuro: en inferencia todo se derrumba.
  • Ignorar el coste cuadrático y lanzar secuencias muy largas contra la memoria de la GPU sin variantes eficientes.

Ejemplo resuelto: coreferencia con dos cabezas

En «María aprobó el examen porque lo estudió a fondo», la palabra «lo» debe apuntar a «examen», no a «María»; las cabezas reparten ese trabajo.

  1. Tokinizas la frase y obtienes una representación por palabra.
  2. Tres proyecciones lineales distintas producen Q, K y V para toda la secuencia.
  3. La cabeza 1 aprende a alinear pronombres con sus sustantivos y orienta «lo» hacia «examen».
  4. La cabeza 2 se ocupa de la sintaxis y refuerza el enlace «estudió» con «María».
  5. Concatenas las salidas, proyectas y sumas el residual: la representación de «lo» ya arrastra su referente.

¿Para qué sirve en la realidad?

Los grandes modelos de lenguaje que responden preguntas, resumen noticias o detectan ironía en redes sociales deben su comprensión del contexto a la autoatención multi-cabeza: sin ella, cada frase sería una bolsa de palabras sin relaciones.

La atención multi-cabeza reparte la dimensión en varias cabezas principalmente para:

La autoatención tiene un coste de memoria y cómputo que crece cuadráticamente con la longitud de la secuencia.

Multi-cabeza

Atención donde Q, K y V salen de la misma secuencia
autoatencion
Varias atenciones paralelas en subespacios
multi-cabeza
Matrices lineales que producen Q, K y V
proyecciones
Enmascarar para que cada posición no vea el futuro
causal
Sumar la salida a la entrada para estabilizar
residual

Toca una tarjeta para ver la respuesta.

Ordena el flujo de una capa de autoatención multi-cabeza:

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada concepto de la autoatención con su rasgo distintivo.

      Dialogar dentro de la frase

      • Autoatención multi-cabeza
        • Auto
          • misma fuente para Q K V
            • cada token mira a todos
            • Cabezas
              • subespacios paralelos
                • concatenar y mezclar
                • Coste
                  • cuadratico en longitud
                    • ventanas y variantes
                    • Estable
                      • residual
                        • normalizacion de capa

                      Tu modelo con secuencias muy largas agota la memoria. ¿Explica por qué la autoatención lo causa y qué dos vías (ventana, cabezas) explorarías para aliviarlo?

                      Tu texto se guarda sólo en este dispositivo.

                      Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                      Autoevaluación

                      Comprueba lo que aprendiste

                      2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                      Iniciar autoevaluación
                      Más sobre esta lección

                      Rutas vivas

                      ¿Y ahora qué? Elige el camino por lo que necesitas

                      No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                      Para profundizar

                      ✦ Explorar el universo completo
                      Explora temas relacionados

                      Conceptos

                      Comentarios

                      Inicia sesión para comentar.

                      Todavía no hay comentarios. Sé la primera persona en opinar.