← Lumbre

Fundamentos de Machine Learning · 5.º División train/validation/test

← Volver a todos los contenidos
Portada de División train/validation/test

División train/validation/test

✦ El error en los datos con que entrenaste no dice nada sobre el mañana · Fundamentos de Machine Learning · Machine Learning · en 6 minutos

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Separar los datos en conjunto de entrenamiento, validación y prueba para medir de forma honesta la generalización y afinar el modelo sin contaminar la evaluación final.

6 min 18–30 años
Autoevaluación
Más
División train/validation/test

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

División train/validation/test

Datos de entrenamiento, validación y prueba
Vídeo en español sobre cómo crear los tres conjuntos de datos y qué objetivo tiene cada uno.

Por qué hace falta separar

El objetivo es la generalización: cómo se comportará con datos nunca vistos. Como no los tenemos, reservamos una porción real de los que sí tenemos y la tratamos como si fuera el futuro. Sin esa reserva, toda estimación del rendimiento sería optimista e inútil.

El conjunto de entrenamiento

Es la mayor parte de los datos, y sirve para ajustar los parámetros del modelo. Aquí el modelo mira las respuestas y aprende. Su error suele ser bajo cuanto más flexible es el modelo, pero ese número no informa sobre el mundo exterior.

El conjunto de validación

Reservado para afinar hiperparámetros y elegir entre candidatos: probamos configuraciones, miramos el error de validación y nos quedamos con la mejor. Este conjunto guía decisiones, así que acaba filtrándose ligeramente al proceso; no sirve para la cifra final honesta.

El conjunto de prueba

Intocable hasta el final. Se usa una sola vez, para reportar el rendimiento con que nos presentamos al mundo. En cuanto lo miramos para tomar decisiones, contamina el proceso y deja de ser prueba honesta: se convierte en validación disfrazada.

Una barra de celdas dividida en tres tramos de colores decrecientes y, debajo, tres montones de tarjetas de datos, el último cerrado con un candado.
La división en tres: entrenamiento (el tramo mayor), validación (para afinar) y prueba (pequeña y sellada), que solo se abre al final para un veredicto honesto.

Por qué tres y no dos

Con solo entrenamiento y prueba, cada ajuste de hiperparámetros se haría mirando la prueba, que gradualmente sobreajustaríamos. La validación absorbe esas decisiones y protege la prueba para que siga siendo un árbitro limpio.

Tamaños típicos

No hay ley universal, pero son comunes proporciones como ochenta por ciento entrenamiento, diez de validación y diez de prueba, o esquemas del noventa y cinco por ciento cuando los datos escasean. Con poco dato, reservar demasiado empobrece el entrenamiento: hay que equilibrar.

Muestreo representativo

Los tres conjuntos deben provenir de la misma distribución y, en clasificación, mantener la mezcla de clases —muestreo estratificado—. Una prueba con proporciones distintas daría una medida engañosa del comportamiento real.

El espejismo del test set único

Un solo corte de prueba da una estimación ruidosa: dos divisiones distintas cambian el número. Con pocos datos, una cifra de prueba puede ser casi azar. De ahí que a menudo se prefieran esquemas de validación cruzada más estables.

Fuga de datos

La contaminación sutil es el enemigo: estandarizar con medias calculadas sobre todos los datos, o incluir duplicados en entrenamiento y prueba a la vez, filtra información del futuro. La división debe hacerse antes de cualquier transformación que use estadísticos.

Errores frecuentes

  • Reutilizar el conjunto de prueba para elegir hiperparámetros una y otra vez.
  • Aplicar transformaciones ajustadas con todos los datos antes de dividir.
  • Celebrar el bajo error de entrenamiento como si fuera capacidad predictiva.

Ejemplo resuelto: partir los datos de un clasificador

Se tienen diez mil clientes etiquetados y hay que medir de forma honesta. El protocolo:

  1. Dividir primero: apartar prueba y validación antes de tocar nada, para no contaminarlas.
  2. Estratificar: conservar en cada porción la misma proporción de clases que en el total.
  3. Entrenar con la porción mayor, ajustando los parámetros del modelo.
  4. Afinar con la validación: elegir configuración mirando solo ese error.
  5. Cerrar la prueba con llave y abrirla una única vez para reportar la cifra final.

¿Para qué sirve en la realidad?

Toda decisión de desplegar un modelo se apoya en estimar su rendimiento futuro. Una división disciplinada evita engañarse con números inflados; una fuga de datos puede hacer fracasar en producción lo que brillaba en el laboratorio.

¿Cuál es la función del conjunto de validación en la división clásica en tres partes?

Tras varias iteraciones afinando con el conjunto de prueba, este sigue siendo una medición honesta.

El precio de mirar demasiado

Cada vez que asomas la nariz al conjunto de prueba para «ver cómo va», pagas con su honestidad. La disciplina exige trabajar con validación y abrir la prueba una única vez, al final, casi con miedo. La tentación de reintentar hasta que salga bien es la trampa que destruye la validez.

Division

Ajusta los parámetros internos
entrenamiento
Sirve para afinar hiperparámetros
validacion
Intocable hasta el reporte final
prueba
Mantener la mezcla de clases al dividir
estratificado
Contaminar la prueba transformando con todos los datos
fuga

Toca una tarjeta para ver la respuesta.

Ordena el uso de los tres conjuntos en un proyecto:

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada conjunto de datos con su papel en el proyecto.

      Tres conjuntos

      • División de datos
        • Entrenar
          • la mayor parte
            • ajusta parámetros
            • Validar
              • afinar hiperparámetros
                • elegir candidatos
                • Probar
                  • una sola vez
                    • veredicto honesto
                    • Cuidados
                      • estratificar
                        • evitar fuga de datos

                      Un compañero ajusta el modelo ochenta veces mirando el accuracy del test set y obtiene noventa y nueve por ciento. ¿Por qué desconfiarías y qué protocolo propondrías?

                      Tu texto se guarda sólo en este dispositivo.

                      Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                      Autoevaluación

                      Comprueba lo que aprendiste

                      2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                      Iniciar autoevaluación
                      Más sobre esta lección

                      Rutas vivas

                      ¿Y ahora qué? Elige el camino por lo que necesitas

                      No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                      Otra forma de comprenderlo

                      ✦ Explorar el universo completo
                      Explora temas relacionados

                      Conceptos

                      Comentarios

                      Inicia sesión para comentar.

                      Todavía no hay comentarios. Sé la primera persona en opinar.