Embeddings de palabras
De disperso a denso
Frente a los enormes vectores dispersos de la bolsa, un embedding es un vector corto y denso, de cientos de dimensiones, donde cada eje no tiene nombre pero el conjunto codifica significado.
Proximidad como semejanza
- Palabras afines quedan cerca según la distancia o el coseno.
- «gato» y «perro» están más próximos que «gato» y «informe».
- La geometría captura categorías y relaciones que nadie programó.
word2vec: predecir contexto
Word2vec entrena una redcilla para predecir el contexto de una palabra (skip-gram) o la palabra dado su contexto (CBOW). Los pesos de la capa intermedia se convierten en los embeddings.
GloVe: cuentas globales
GloVe parte de las estadísticas de coocurrencia de todo el corpus y busca vectores cuyo producto interno reproduzca esas frecuencias. Complementa la visión local de word2vec con información global.

Analogías vectoriales
La famosa «rey - hombre + mujer ≈ reina» muestra que ciertas relaciones se codifican como direcciones casi paralelas. Los operadores entre vectores revelan estructura semántica y sintáctica.
Entrenar los embeddings
Se aprenden a partir de corpus enormes sin etiquetar, solo observando contextos. Por eso se dice que son representaciones auto-supervisadas del lenguaje.
Embeddings estáticos frente a contextuales
Word2vec y GloVe dan un único vector por palabra, incapaz de distinguir el «banco» donde te sientas del «banco» financiero. Los contextuales modernos resuelven esa ambigüedad según la frase.
Sesgos en el espacio
Al aprender de texto humano, los embeddings heredan estereotipos: ciertas profesiones se alinean con géneros. Reconocerlo es parte del uso responsable.
Para qué sirven
Como entrada de clasificadores, buscadores semánticos o sistemas de recomendación, los densos y compactos embeddings siguen siendo una pieza fundamental del procesamiento del lenguaje.
Errores frecuentes
- Creer que cada eje del vector tiene un significado humano: son dimensiones aprendidas, no etiquetas.
- Usar un embedding estático para palabras ambiguas y no distinguir el «banco» de sentarse del financiero.
- Ignorar que los embeddings heredan los sesgos del texto humano con que se entrenaron.
Ejemplo resuelto: resolver una analogía
Quieres comprobar que los vectores capturan relaciones y pruebas una analogía:
- Cargas embeddings entrenados de un modelo como word2vec o GloVe.
- Tomas los vectores de «rey», «hombre» y «mujer».
- Calculas rey menos hombre más mujer.
- Buscas el vector más cercano por similitud de coseno.
- Recuperas «reina», confirmando la regularidad semántica.
¿Para qué sirve en la realidad?
Los embeddings son la puerta vectorial al lenguaje: alimentan buscadores semánticos, recomendadores y clasificadores, y allanaron el camino a los modelos contextuales de hoy.
La hipotesis distribucional que fundamenta los embeddings afirma que:
Un embedding estático de word2vec asigna el mismo vector a «banco» sea financiero o de sentarse.
Embeddings
Toca una tarjeta para ver la respuesta.
Ordena la lógica de cómo nace un embedding de word2vec:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Word2vecAprendizaje de representaciones vectoriales de palabras.
Une cada idea de los embeddings con su término.
Dime tu contexto y sabré quién eres
- Embeddings de palabras
- Idea
- el contexto define el significado
- el contexto define el significado
- cercanía igual a semejanza
- Idea
- word2vec local
- direcciones paralelas
- un vector por palabra
Word embeddingRepresentaciones vectoriales densas del significado de las palabras.
Tu modelo confunde «Java» (isla) con «Java» (lenguaje). ¿Por qué un embedding estático falla aquí y qué lo resolvería?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.