Autoatención multi-cabeza
Auto: Q, K y V de la misma fuente
En la autoatención, consulta, claves y valores provienen de la misma secuencia de entradas. Cada posición se consulta a sí misma y a las demás, capturando dependencias internas.
Proyecciones aprendidas
- Tres matrices lineales distintas generan Q, K y V desde las mismas representaciones.
- Esas proyecciones son lo que se entrena, no los pesos de atención explícitos.
- Sin ellas, Q e K serían idénticos y la atención perdería expresividad.
Varias cabezas en paralelo
La atención multi-cabeza divide la dimensión en varias «cabezas», cada una con sus proyecciones. Cada cabeza aprende a atender a un tipo de relación distinto.
Subespacios de representación
Cada cabeza proyecta a un subespacio de menor dimensión y realiza su propia atención. Luego se concatenan las salidas y se mezclan con una proyección final.
Qué ganan las cabezas
Una cabeza puede ocuparse de la sintaxis, otra de referencias entre palabras, otra de proximidad local. Repartir el trabajo mejora la riqueza contextual.

Coste cuadrático
La matriz de afinidades QK elevado a T tiene tamaño longitud por longitud. Duplicar la longitud cuadruplica el cómputo y la memoria: el gran cuello de botella de los transformers.
Paralelismo frente a recurrencia
- La atención procesa todos los tokens a la vez, sin cadenas secuenciales.
- Eso explota la GPU mejor que el paso a paso de una recurrente.
- El precio es la complejidad cuadrática en la longitud.
Máscara causal
En generación se enmascara el futuro: cada posición solo puede mirar a las anteriores. Así el modelo no hace trampa leyendo lo que debe predecir.
Residual y normalización
La salida de atención se suma a la entrada (conexión residual) y se normaliza. Esto estabiliza redes muy apiladas y facilita el flujo del gradiente.
Cabezas y dimensiones
Más cabezas no siempre es mejor: cada una tendrá menos dimensión. Se busca un equilibrio entre número de cabezas y anchura por cabeza.
Errores frecuentes
- Creer que más cabezas son gratis: cada cabeza padece menos dimensión y el coste total no baja.
- Generar sin máscara causal y que el modelo entrene viendo el futuro: en inferencia todo se derrumba.
- Ignorar el coste cuadrático y lanzar secuencias muy largas contra la memoria de la GPU sin variantes eficientes.
Ejemplo resuelto: coreferencia con dos cabezas
En «María aprobó el examen porque lo estudió a fondo», la palabra «lo» debe apuntar a «examen», no a «María»; las cabezas reparten ese trabajo.
- Tokinizas la frase y obtienes una representación por palabra.
- Tres proyecciones lineales distintas producen Q, K y V para toda la secuencia.
- La cabeza 1 aprende a alinear pronombres con sus sustantivos y orienta «lo» hacia «examen».
- La cabeza 2 se ocupa de la sintaxis y refuerza el enlace «estudió» con «María».
- Concatenas las salidas, proyectas y sumas el residual: la representación de «lo» ya arrastra su referente.
¿Para qué sirve en la realidad?
Los grandes modelos de lenguaje que responden preguntas, resumen noticias o detectan ironía en redes sociales deben su comprensión del contexto a la autoatención multi-cabeza: sin ella, cada frase sería una bolsa de palabras sin relaciones.
La atención multi-cabeza reparte la dimensión en varias cabezas principalmente para:
La autoatención tiene un coste de memoria y cómputo que crece cuadráticamente con la longitud de la secuencia.
Multi-cabeza
Toca una tarjeta para ver la respuesta.
Ordena el flujo de una capa de autoatención multi-cabeza:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Atención multi-cabezaCabezas de atención paralelas sobre subespacios de representación.
Une cada concepto de la autoatención con su rasgo distintivo.
Dialogar dentro de la frase
- Autoatención multi-cabeza
- Auto
- misma fuente para Q K V
- misma fuente para Q K V
- cada token mira a todos
- Auto
- subespacios paralelos
- cuadratico en longitud
- residual
Autoatención (self-attention)Ficha técnica de la atención donde la secuencia se consulta a sí misma.
Tu modelo con secuencias muy largas agota la memoria. ¿Explica por qué la autoatención lo causa y qué dos vías (ventana, cabezas) explorarías para aliviarlo?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.