← Lumbre

Fundamentos de Ciencia de Datos · 1.º Datos estructurados y no estructurados

← Volver a todos los contenidos
Portada de Datos estructurados y no estructurados

Datos estructurados y no estructurados

✦ No todos los datos caben en una tabla · Fundamentos de Ciencia de Datos · Análisis de Datos · 6 minutos que valen la pena

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Clasificar los datos según su grado de estructura y explicar qué implica cada tipo para su almacenamiento, análisis y extracción de valor.

6 min 18–30 años
Autoevaluación
Más
Datos estructurados y no estructurados

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Datos estructurados y no estructurados

La estructura de un dato es cuánta organización viene «de fábrica». Un dato muy estructurado ya tiene sus piezas separadas y etiquetadas; uno no estructurado es materia prima bruta de la que hay que extraer la organización a mano.

Datos estructurados, semiestructurados y no estructurados
Cómo distinguir los tres grados de estructura y por qué importa.

Datos estructurados

Se organizan en filas y columnas con un esquema fijo: cada campo tiene un nombre, un tipo y un significado claro. Son los que mejor entienden las bases de datos relacionales y las hojas de cálculo.

El mismo hecho puede guardarse en los tres niveles; lo que cambia es cuánto sabemos de antemano sobre su forma.
GradoEjemplo típicoDónde viveDificultad de análisis
EstructuradoTransacciones, clientes, sensores con campos fijosBase de datos relacional, CSVBaja: se consulta directo
SemiestructuradoRegistros de eventos, respuestas de APIJSON, XML, logsMedia: hay que interpretar etiquetas
No estructuradoTexto libre, audio, imagen, vídeoArchivos, objetos en la nubeAlta: exige extraer la estructura

Datos semiestructurados

Tienen algo de organización, pero flexible: etiquetas y jerarquías que no se ajustan a un esquema rígido. El JSON es el rey actual: anida valores, permite que un registro tenga campos que otro no tiene, y por eso domina el intercambio entre servicios web.

Datos no estructurados

Texto libre, fotografías, audio, vídeo, publicaciones en redes. No traen campos ni tipos: la estructura hay que descubrirla. Aquí vive, según estimaciones comunes, la mayor parte del dato que una organización posee y, paradójicamente, la que menos aprovecha.

Por qué importa la distinción

  • Determina el coste: estructurar texto o imagen es trabajo adicional que no existe con una tabla.
  • Determina la herramienta: SQL brilla con lo estructurado; el lenguaje natural y la visión por computador atacan lo no estructurado.
  • Determina la pregunta legítima: no puedes prometer una tendencia temporal a datos que no llevan fecha.

Del dato bruto a la característica

Para analizar lo no estructurado hay que transformarlo en algo medible: convertir un texto en frecuencias o vectores, una imagen en píxeles o descriptores, un audio en espectros. Esa conversión —la ingeniería de características sobre datos crudos— es donde se gana o se pierde el proyecto.

Tabla ordenada a la izquierda, árbol JSON en el centro y documentos, música y foto sueltos a la derecha
De la tabla al archivo suelto: cuanto menos estructura de fábrica, más trabajo de análisis.

Metadatos y esquema

Un diccionario de datos que explique qué significa cada campo, de dónde sale y con qué unidades se mide vale oro. Sin metadatos, incluso un archivo perfectamente estructurado se vuelve ininterpretable a los seis meses.

El reto del volumen

  • Lo estructurado crece en filas; lo no estructurado, en gigabytes por archivo.
  • Almacenar imagen o vídeo barato abrió la puerta a analizarlos en masa.
  • El coste no está en guardar, sino en procesar y entender.

Cómo se guardan

Los almacenes combinan piezas: bases relacionales para lo tabular, almacenes de objetos para ficheros grandes, índices para buscar texto. Un buen arquitecto de datos elige el contenedor según la forma del dato, no al revés.

Errores frecuentes de novato

  • Tratar un JSON anidado como si fuera una tabla plana y perder información.
  • Asumir que una columna de texto libre es categorical y contarla sin limpiar.
  • Ignorar que una imagen o un audio contienen la señal relevante del problema.

Ejemplo resuelto: de un audio de llamada a un dato analizable

Una empresa guarda miles de grabaciones de atención al cliente y quiere saber de qué se queja la gente. El camino para volverlas analizables:

  1. Reconocer que el audio es dato no estructurado: no trae campos.
  2. Transcribir el audio a texto con reconocimiento de voz.
  3. Extraer temas o intenciones con procesamiento de lenguaje.
  4. Convertir cada llamada en variables medibles como tema y sentimiento.
  5. Unir esas columnas a la tabla de clientes para poder consultarlas.

¿Para qué sirve en la realidad?

Clasificar bien el tipo de dato evita prometer análisis imposibles y obliga a presupuestar el trabajo de estructurar: ahí está la mayor parte del coste real de un proyecto con texto, imagen o audio.

Un conjunto de archivos de audio de llamadas al cliente es, por su naturaleza, dato:

Todos los datos guardados en un archivo JSON son automáticamente estructurados.

Cada tipo tiene herramientas naturales; forzar una herramienta sobre el tipo equivocado produce basura.
Tipo de datoMejor aliado de análisisPregunta que responde bien
EstructuradoSQL y estadística descriptivaCuánto, cuándo, cuánto cambió
SemiestructuradoParseo y aplanado de JSONPatrones en eventos y logs
No estructuradoProcesamiento de lenguaje y visiónQué dicen, qué muestran

Clasifica cada fuente de datos según su estructura.

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada fuente con su grado de estructura:

      La forma del dato

      • Tipos de datos
        • Estructurado
          • filas y columnas
            • esquema fijo
              • consulta directa
              • Semiestructurado
                • etiquetas flexibles
                  • JSON y registros de eventos
                  • No estructurado
                    • texto, audio, imagen
                      • hay que extraer la forma

                    Una clínica tiene historiales en PDF escaneado y una tabla de citas. Explica en dos frases qué datos son estructurados, cuáles no, y qué habría que hacer antes de poder analizar los PDF.

                    Tu texto se guarda sólo en este dispositivo.

                    Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                    Autoevaluación

                    Comprueba lo que aprendiste

                    2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                    Iniciar autoevaluación
                    Más sobre esta lección

                    Rutas vivas

                    ¿Y ahora qué? Elige el camino por lo que necesitas

                    No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                    Otra forma de comprenderlo

                    ✦ Explorar el universo completo
                    Explora temas relacionados

                    Conceptos

                    Comentarios

                    Inicia sesión para comentar.

                    Todavía no hay comentarios. Sé la primera persona en opinar.