Las primeras capas de una red convolucional profunda aprenden bordes, texturas y partes; las últimas, semántica de la tarea fuente. Ese conocimiento visual transfiere a tareas nuevas con pocas etiquetas. Cuando ni siquiera hay etiquetas suficientes para el pretraining propio, entra el aprendizaje auto-supervisado: construir la señal de supervisión de las propias imágenes sin anotar.
Por qué la extracción manual de rasgos perdió
- SIFT y HOG codifican hipótesis fijas sobre qué importa en una imagen.
- Un dataset grande permite que la red aprenda sus propios rasgos para la tarea.
- La transferencia funciona porque los rasgos bajos son compartidos entre dominios visuales.

Las tres recetas de transferencia
- Extractor congelado: features del backbone + clasificador lineal encima.
- Ajuste fino (fine-tuning): desplegar el backbone completo con tasa de aprendizaje pequeña.
- Ajuste parcial: congelar bloques bajos, entrenar los altos junto con la cabecera.
Auto-supervisión: un profesor sin etiquetas
Las tareas pretextos engañan a la red para que aprenda estructura: predicción de rompecabezas, modelo de relleno (inpainting) o, en la familia MAE, enmascarar parches de la imagen y reconstruirlos. La línea contrastiva —SimCLR, MoCo— aprende de dos vistas aumentadas de la misma imagen: cerca en el espacio latente lo que coincide, lejos lo que no. DINO y su segundo acto produjeron atenciones que ya segmentan objetos sin una sola caja.
CLIP: el puente con el lenguaje
Al entrenar una imagen y su descripción para que se encuentren en un espacio común, CLIP hereda una capacidad inesperada: clasificar por lenguaje. Se le puede pedir "foto de un refractómetro industrial" sin haber visto nunca esa clase: clasificación cero-shot con la lista de etiquetas como prompt.
Elegir la receta: presupuesto de datos
- Cero etiquetas en la tarea: backbone auto-supervisado más prototipos o CLIP.
- Decenas por clase: extractor congelado con regularización fuerte.
- Cientos por clase: fine-tuning parcial con aumentos agresivos.
- Miles y dominio lejano: fine-tuning completo y validación que imite al despliegue.
| Receta | Pide / Entrega |
|---|---|
| Extractor congelado | pocas etiquetas; rápida, techo bajo |
| Fine-tuning | más etiquetas; mejor precisión, más costo |
| Auto-supervisado previo | sin etiquetas de tarea; buen punto de partida |
| CLIP cero-shot | ninguna; flexibilidad de clase abierta |
Errores frecuentes
- Entrenar desde cero con 2 mil imágenes: sobreajuste garantizado.
- Normalizar con la media del entrenamiento y sorprenderse del dominio real (brecha de dominio).
- Aumentar con transformaciones que destruyen la etiqueta (giro de 90 grados en un histograma médico).
- Usar el conjunto de validación para elegir la tasa de aprendizaje del fine-tuning: fuga silenciosa.
Ejemplo resuelto: detección de defectos con 800 imágenes etiquetadas
- Backbone auto-supervisado (DINO o MAE) en las 40 mil imágenes sin etiqueta de la planta.
- Cabecera de detección ligera sobre bloques altos, con los bloques bajos congelados.
- Aumentos que respetan la física: brillo, oclusión parcial, corte y rotaciones pequeñas.
- Validación con el lote del turno nocturno para medir brecha real.
- Iterar el etiquetado activo donde la incertidumbre del ensemble sea alta.
¿Para qué sirve en la realidad?
Inspección industrial, diagnóstico asistido, agro y sensores remotos comparten el mismo retrato: datos sobran, etiquetas escasean. La transferencia y la auto-supervisión son la razón por la que una startup con un smartphone compite en visión con quien tenía un dataset de millones.
¿Qué hace posible el aprendizaje auto-supervisado en visión?
En CLIP, las clases que se pueden reconocer en cero-shot deben haber aparecido en el entrenamiento del modelo.
La familia de métodos que aprende de dos vistas aumentadas de la misma imagen se llama aprendizaje .
Clasifica cada técnica según el presupuesto de datos que presupone.
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Une cada método con su idea central.
Transferencia visual
Toca una tarjeta para ver la respuesta.
Transferencia visual
- Transferencia y auto-supervisión
- Por qué
- rasgos compartidos
- rasgos compartidos
- costo de etiquetas
- Por qué
- congelar backbone
- MAE
- cero-shot
Aprendizaje auto-supervisado (Wikipedia)Construir la señal de supervisión a partir de los propios datos sin anotar.
Aprendizaje contrastivo (Wikipedia)Acercar vistas positivas y alejar negativas: la familia de SimCLR.
Para clasificar cinco tipos de defecto en piezas tienes 900 fotos etiquetadas y 50 mil sin anotar. Argumenta la ruta de transferencia que elegirías (qué congelas, qué ajustas, qué aumentos usas) y cómo medirías la brecha entre tu validación y la línea de producción real.
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.