Versionado de datos y modelos
Qué hay que versionar
- Los datasets de entrenamiento y validación.
- El código de preparación y del propio entrenamiento.
- Los artefactos del modelo y sus hiperparámetros.
Reproducibilidad
Poder volver a obtener exactamente el mismo modelo a partir de las mismas entradas. Sin versionado, un resultado de ayer es irrepetible y por tanto inútil para auditar.
El registro de modelos
Un almacén central guarda cada versión del modelo con sus métricas, parámetros y metadatos. Permite comparar, recuperar y promover un candidato a producción.
Versionado de datos
Herramientas tipo instantáneas de datos capturan el estado exacto de un conjunto en un momento, como un commit pero para tablas voluminosas.
Linaje del dato
- Rastrear de qué datos crudos viene cada conjunto.
- Conocer las transformaciones aplicadas en el camino.
- Esencial para depurar y cumplir normativas.
Experimentos trazables
Cada entrenamiento queda registrado: datos usados, código, parámetros, entorno y resultados. Así se sabe por qué una corrida batió a otra.
Entornos y dependencias
Fijar versiones de librerías y del motor importa: el mismo código con otra dependencia puede dar otro modelo. El versionado incluye el entorno.

Comparar y revertir
Con versiones claras se comparan métricas lado a lado y se revierte a un modelo anterior si el nuevo regresa. Cambiar de idea sin miedo.
Etiquetas y estados
- Marcar versiones como candidato, en producción o archivado.
- Los estados gobiernan qué versión sirve.
- Una etiqueta vale más que un identificador opaco.
No versionar binarios gigantes a mano
Copiar archivos «modelo_final_v3_REAL» es una mala señal. El versionado debe ser sistemático, con metadatos buscables, no una colección de nombres improvisados.
Errores frecuentes
- Guardar solo el código y creer que eso basta para reproducir un modelo entrenado.
- Apelar a archivos como modelo final v3 real en vez de un registro sistemático con metadatos.
- Promover a producción sin etiquetar estados y no saber qué versión se está sirviendo.
Ejemplo resuelto: reproducir un modelo premiado
Un experimento que batió el registro anterior queda fijado con su versión exacta de dataset, su código y parámetros, su entorno con dependencias y el artefacto con métricas. Semanas después, otro ingeniero puede relanzar la corrida y obtener el mismo modelo, o revertir a él si el nuevo empeora.
- fijar la versión exacta del dataset empleado
- guardar el código de preparación y entrenamiento con sus parámetros
- registrar librerías y versión del entorno
- almacenar el artefacto del modelo con sus métricas
- etiquetar la versión como candidata o en producción
¿Para qué sirve en la realidad?
Equipos que deben auditar por qué un modelo decidió algo, o cumplir normativas que exigen rastrear los datos de origen, dependen de un versionado que enlace cada predicción con su linaje completo.
El versionado de datos y modelos contribuye sobre todo a:
Versionar solo el código fuente basta para reproducir exactamente un modelo entrenado.
Versionado
Toca una tarjeta para ver la respuesta.
Ordena qué registrar en un experimento reproducible:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Control de versionesGestión del cambio de artefactos a lo largo del tiempo.
Une cada concepto de versionado con su definición:
Versionado
- Versionado
- Qué versionar
- datasets
- datasets
- código
- Qué versionar
- hiperparámetros
- métricas
- linaje del dato
- comparar
Linaje de datosRastreo del origen y las transformaciones de los datos a lo largo de un pipeline.
Un modelo en producción rinde de pronto peor y nadie sabe con qué datos se entrenó. ¿Qué eslabón del versionado falló y cómo lo arreglarías?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.