Modelo, parámetros e hipótesis
El modelo como familia de funciones
Una regresión lineal no es una recta: es el conjunto de todas las rectas posibles, cada una definida por su pendiente e intercepto. Al elegir ese modelo, elegimos qué familia de funciones podrá salir del entrenamiento —rectas, y no parábolas—, aunque todavía no sepamos cuál.
Parámetros frente a hiperparámetros
Los parámetros los fija el entrenamiento mirando los datos —la pendiente aprendida—. Los hiperparámetros los decide el practicante antes de empezar —el grado del polinomio, la profundidad del árbol—. Los primeros se aprenden; los segundos se eligen, normalmente con validación.
El espacio de hipótesis
La colección de todas las funciones que el modelo puede representar es su espacio de hipótesis. Un modelo lineal tiene un espacio pobre: solo rectas o planos. Una red profunda, un espacio vastísimo. El entrenamiento solo podrá encontrar la verdad si esta vive dentro de ese espacio.

Entrenar es buscar
El aprendizaje es una búsqueda y selección dentro del espacio de hipótesis: probar parámetros, medir cuán mal quedan y moverse hacia los que ajustan mejor. Elegir un modelo es, antes que nada, acotar dónde se va a buscar.
El sesgo inductivo
Ningún aprendizaje ocurre sin suposiciones previas: preferir relaciones suaves, o simples, o periódicas. Ese sesgo inductivo es lo que permite generalizar más allá de los datos vistos. Sin sesgo, todo conjunto finito de puntos es igual de compatible con infinitas reglas: no se aprende nada.
Capacidad expresiva frente a riesgo
Un espacio enorme puede aproximar casi cualquier cosa, incluida el ruido: mucho margen para sobreajustar. Un espacio pequeño generaliza con seguridad pero puede quedarse corto y subajustar. La elección del modelo es un ajuste entre flexibilidad y riesgo.
La forma importa
Si la realidad es una curva y elegimos rectas, ninguna cantidad de datos arreglará un techo de error. El modelo impone una estructura al mundo. Buena parte del oficio es intuir, dominar el problema y traducirla a la familia de funciones adecuada.
Objetivo: una función pérdida
Para buscar hace falta un criterio que diga cuándo una hipótesis es mejor. Ese papel lo juega la función pérdida, que puntúa el error del modelo. Todo el entrenamiento es, en el fondo, minimizar esa pérdida sobre los datos.
Errores frecuentes
- Creer que más entrenamiento ampliará el espacio de hipótesis: el modelo no puede salir de su familia.
- Confundir parámetros que se aprenden con hiperparámetros que se eligen.
Ejemplo resuelto: elegir la familia de un modelo
Se quiere predecir la demanda de la semana a partir del histórico. El diseño avanza así:
- Observar la forma: la demanda sube y baja cada semana, sugiere periodicidad, no una recta.
- Acotar el espacio: elegir una familia capaz de representar ondas, no solo líneas rectas.
- Distinguir roles: la pendiente o el peso se aprenden; el grado del modelo se elige.
- Fijar la pérdida: definir cómo se puntúa el error para que la búsqueda tenga rumbo.
- Entrenar y validar: buscar los parámetros que minimizan la pérdida y comprobar que generaliza.
¿Para qué sirve en la realidad?
Buena parte de los fracasos en proyectos de datos no son de código sino de elección: un modelo demasiado rígido tiene un techo de error que ningún dato arregla. Entender el espacio de hipótesis evita prometer lo imposible y guía hacia la familia adecuada.
El «espacio de hipótesis» de un modelo es:
Los hiperparámetros de un modelo se aprenden automáticamente a partir de los datos.
Sin datos no hay hipótesis que valga
El espacio de hipótesis y el sesgo definen qué se puede aprender; los datos deciden cuál de esas candidatas se elige. Un modelo rico con datos pobres quedará determinado al azar; unos datos abundantes apenas rescatan a un modelo demasiado rígido. Las dos piezas importan.
Modelos
Toca una tarjeta para ver la respuesta.
Ordena del concepto más general al más específico:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
ExplainedVisualizaciones intuitivas sobre modelos, espacios de hipótesis y optimización.
Une cada concepto del modelo con lo que define.
Qué es un modelo
- Modelo e hipótesis
- Familia
- todas las funciones
- todas las funciones
- límites del modelo
- Familia
- parámetros
- minimizar la pérdida
- muy rígido subajusta
¿Qué es la función de pérdida?Explicación de referencia en español sobre la pérdida que guía el entrenamiento.
Sabes que tu fenómeno es periódico, pero eliges un modelo lineal. ¿Qué límite de error te impones aunque acumules miles de datos, y qué familia probarías en su lugar?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.