División train/validation/test
Por qué hace falta separar
El objetivo es la generalización: cómo se comportará con datos nunca vistos. Como no los tenemos, reservamos una porción real de los que sí tenemos y la tratamos como si fuera el futuro. Sin esa reserva, toda estimación del rendimiento sería optimista e inútil.
El conjunto de entrenamiento
Es la mayor parte de los datos, y sirve para ajustar los parámetros del modelo. Aquí el modelo mira las respuestas y aprende. Su error suele ser bajo cuanto más flexible es el modelo, pero ese número no informa sobre el mundo exterior.
El conjunto de validación
Reservado para afinar hiperparámetros y elegir entre candidatos: probamos configuraciones, miramos el error de validación y nos quedamos con la mejor. Este conjunto guía decisiones, así que acaba filtrándose ligeramente al proceso; no sirve para la cifra final honesta.
El conjunto de prueba
Intocable hasta el final. Se usa una sola vez, para reportar el rendimiento con que nos presentamos al mundo. En cuanto lo miramos para tomar decisiones, contamina el proceso y deja de ser prueba honesta: se convierte en validación disfrazada.

Por qué tres y no dos
Con solo entrenamiento y prueba, cada ajuste de hiperparámetros se haría mirando la prueba, que gradualmente sobreajustaríamos. La validación absorbe esas decisiones y protege la prueba para que siga siendo un árbitro limpio.
Tamaños típicos
No hay ley universal, pero son comunes proporciones como ochenta por ciento entrenamiento, diez de validación y diez de prueba, o esquemas del noventa y cinco por ciento cuando los datos escasean. Con poco dato, reservar demasiado empobrece el entrenamiento: hay que equilibrar.
Muestreo representativo
Los tres conjuntos deben provenir de la misma distribución y, en clasificación, mantener la mezcla de clases —muestreo estratificado—. Una prueba con proporciones distintas daría una medida engañosa del comportamiento real.
El espejismo del test set único
Un solo corte de prueba da una estimación ruidosa: dos divisiones distintas cambian el número. Con pocos datos, una cifra de prueba puede ser casi azar. De ahí que a menudo se prefieran esquemas de validación cruzada más estables.
Fuga de datos
La contaminación sutil es el enemigo: estandarizar con medias calculadas sobre todos los datos, o incluir duplicados en entrenamiento y prueba a la vez, filtra información del futuro. La división debe hacerse antes de cualquier transformación que use estadísticos.
Errores frecuentes
- Reutilizar el conjunto de prueba para elegir hiperparámetros una y otra vez.
- Aplicar transformaciones ajustadas con todos los datos antes de dividir.
- Celebrar el bajo error de entrenamiento como si fuera capacidad predictiva.
Ejemplo resuelto: partir los datos de un clasificador
Se tienen diez mil clientes etiquetados y hay que medir de forma honesta. El protocolo:
- Dividir primero: apartar prueba y validación antes de tocar nada, para no contaminarlas.
- Estratificar: conservar en cada porción la misma proporción de clases que en el total.
- Entrenar con la porción mayor, ajustando los parámetros del modelo.
- Afinar con la validación: elegir configuración mirando solo ese error.
- Cerrar la prueba con llave y abrirla una única vez para reportar la cifra final.
¿Para qué sirve en la realidad?
Toda decisión de desplegar un modelo se apoya en estimar su rendimiento futuro. Una división disciplinada evita engañarse con números inflados; una fuga de datos puede hacer fracasar en producción lo que brillaba en el laboratorio.
¿Cuál es la función del conjunto de validación en la división clásica en tres partes?
Tras varias iteraciones afinando con el conjunto de prueba, este sigue siendo una medición honesta.
El precio de mirar demasiado
Cada vez que asomas la nariz al conjunto de prueba para «ver cómo va», pagas con su honestidad. La disciplina exige trabajar con validación y abrir la prueba una única vez, al final, casi con miedo. La tentación de reintentar hasta que salga bien es la trampa que destruye la validez.
Division
Toca una tarjeta para ver la respuesta.
Ordena el uso de los tres conjuntos en un proyecto:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
ExplainedExplicaciones visuales sobre validación y generalización en modelos.
Une cada conjunto de datos con su papel en el proyecto.
Tres conjuntos
- División de datos
- Entrenar
- la mayor parte
- la mayor parte
- ajusta parámetros
- Entrenar
- afinar hiperparámetros
- una sola vez
- estratificar
Conjuntos de entrenamiento, validación y pruebaReferencia en español sobre la división de datos y sus objetivos.
Un compañero ajusta el modelo ochenta veces mirando el accuracy del test set y obtiene noventa y nueve por ciento. ¿Por qué desconfiarías y qué protocolo propondrías?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.