Datos estructurados y no estructurados
La estructura de un dato es cuánta organización viene «de fábrica». Un dato muy estructurado ya tiene sus piezas separadas y etiquetadas; uno no estructurado es materia prima bruta de la que hay que extraer la organización a mano.
Datos estructurados
Se organizan en filas y columnas con un esquema fijo: cada campo tiene un nombre, un tipo y un significado claro. Son los que mejor entienden las bases de datos relacionales y las hojas de cálculo.
| Grado | Ejemplo típico | Dónde vive | Dificultad de análisis |
|---|---|---|---|
| Estructurado | Transacciones, clientes, sensores con campos fijos | Base de datos relacional, CSV | Baja: se consulta directo |
| Semiestructurado | Registros de eventos, respuestas de API | JSON, XML, logs | Media: hay que interpretar etiquetas |
| No estructurado | Texto libre, audio, imagen, vídeo | Archivos, objetos en la nube | Alta: exige extraer la estructura |
Datos semiestructurados
Tienen algo de organización, pero flexible: etiquetas y jerarquías que no se ajustan a un esquema rígido. El JSON es el rey actual: anida valores, permite que un registro tenga campos que otro no tiene, y por eso domina el intercambio entre servicios web.
Datos no estructurados
Texto libre, fotografías, audio, vídeo, publicaciones en redes. No traen campos ni tipos: la estructura hay que descubrirla. Aquí vive, según estimaciones comunes, la mayor parte del dato que una organización posee y, paradójicamente, la que menos aprovecha.
Por qué importa la distinción
- Determina el coste: estructurar texto o imagen es trabajo adicional que no existe con una tabla.
- Determina la herramienta: SQL brilla con lo estructurado; el lenguaje natural y la visión por computador atacan lo no estructurado.
- Determina la pregunta legítima: no puedes prometer una tendencia temporal a datos que no llevan fecha.
Del dato bruto a la característica
Para analizar lo no estructurado hay que transformarlo en algo medible: convertir un texto en frecuencias o vectores, una imagen en píxeles o descriptores, un audio en espectros. Esa conversión —la ingeniería de características sobre datos crudos— es donde se gana o se pierde el proyecto.

Metadatos y esquema
Un diccionario de datos que explique qué significa cada campo, de dónde sale y con qué unidades se mide vale oro. Sin metadatos, incluso un archivo perfectamente estructurado se vuelve ininterpretable a los seis meses.
El reto del volumen
- Lo estructurado crece en filas; lo no estructurado, en gigabytes por archivo.
- Almacenar imagen o vídeo barato abrió la puerta a analizarlos en masa.
- El coste no está en guardar, sino en procesar y entender.
Cómo se guardan
Los almacenes combinan piezas: bases relacionales para lo tabular, almacenes de objetos para ficheros grandes, índices para buscar texto. Un buen arquitecto de datos elige el contenedor según la forma del dato, no al revés.
Errores frecuentes de novato
- Tratar un JSON anidado como si fuera una tabla plana y perder información.
- Asumir que una columna de texto libre es categorical y contarla sin limpiar.
- Ignorar que una imagen o un audio contienen la señal relevante del problema.
Ejemplo resuelto: de un audio de llamada a un dato analizable
Una empresa guarda miles de grabaciones de atención al cliente y quiere saber de qué se queja la gente. El camino para volverlas analizables:
- Reconocer que el audio es dato no estructurado: no trae campos.
- Transcribir el audio a texto con reconocimiento de voz.
- Extraer temas o intenciones con procesamiento de lenguaje.
- Convertir cada llamada en variables medibles como tema y sentimiento.
- Unir esas columnas a la tabla de clientes para poder consultarlas.
¿Para qué sirve en la realidad?
Clasificar bien el tipo de dato evita prometer análisis imposibles y obliga a presupuestar el trabajo de estructurar: ahí está la mayor parte del coste real de un proyecto con texto, imagen o audio.
Un conjunto de archivos de audio de llamadas al cliente es, por su naturaleza, dato:
Todos los datos guardados en un archivo JSON son automáticamente estructurados.
| Tipo de dato | Mejor aliado de análisis | Pregunta que responde bien |
|---|---|---|
| Estructurado | SQL y estadística descriptiva | Cuánto, cuándo, cuánto cambió |
| Semiestructurado | Parseo y aplanado de JSON | Patrones en eventos y logs |
| No estructurado | Procesamiento de lenguaje y visión | Qué dicen, qué muestran |
Clasifica cada fuente de datos según su estructura.
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Datos no estructuradosInformación que no sigue un modelo de datos predefinido.
Une cada fuente con su grado de estructura:
La forma del dato
- Tipos de datos
- Estructurado
- filas y columnas
- filas y columnas
- esquema fijo
- Estructurado
- consulta directa
- etiquetas flexibles
- texto, audio, imagen
MetadatosLa información que explica qué significa cada dato y de dónde viene.
Una clínica tiene historiales en PDF escaneado y una tabla de citas. Explica en dos frases qué datos son estructurados, cuáles no, y qué habría que hacer antes de poder analizar los PDF.
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.