← Lumbre

Visión por Computadora · 7.º Transferencia y aprendizaje auto-supervisado en visión

← Volver a todos los contenidos
Portada de Transferencia y aprendizaje auto-supervisado en visión

Transferencia y aprendizaje auto-supervisado en visión

✦ Cómo ver bien con pocas etiquetas: rasgos compartidos entre dominios, recetas de congelado y ajuste fino, tareas pretextos auto-supervisadas y clasificación cero-shot por lenguaje · Visión por Computadora · Inteligencia Artificial · en menos de 6 minutos

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Seleccionar la ruta de transferencia o auto-supervisión adecuada al presupuesto de etiquetas: congelado, fine-tuning, MAE, contrastivo, DINO y CLIP.

6 min 18–30 años
Autoevaluación
Más
Transferencia y aprendizaje auto-supervisado en visión

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Transferencia y aprendizaje auto-supervisado en visión

Aprendizaje auto-supervisado en visión
Video explicativo (inglés): qué es el aprendizaje auto-supervisado y por qué es clave para representar imágenes sin etiquetado.

Las primeras capas de una red convolucional profunda aprenden bordes, texturas y partes; las últimas, semántica de la tarea fuente. Ese conocimiento visual transfiere a tareas nuevas con pocas etiquetas. Cuando ni siquiera hay etiquetas suficientes para el pretraining propio, entra el aprendizaje auto-supervisado: construir la señal de supervisión de las propias imágenes sin anotar.

Por qué la extracción manual de rasgos perdió

  • SIFT y HOG codifican hipótesis fijas sobre qué importa en una imagen.
  • Un dataset grande permite que la red aprenda sus propios rasgos para la tarea.
  • La transferencia funciona porque los rasgos bajos son compartidos entre dominios visuales.
Diagrama de cuatro bandas: el dataset etiquetado pequeño del dominio meta; el pretraining ImageNet o auto-supervisado en el dominio fuente; el backbone congelado o ajustado; y la cabecera de la tarea final: clasificación, detección o segmentación.
El cuello de botella ya no son los datos de la tarea: es un buen backbone que los aproveche.

Las tres recetas de transferencia

  • Extractor congelado: features del backbone + clasificador lineal encima.
  • Ajuste fino (fine-tuning): desplegar el backbone completo con tasa de aprendizaje pequeña.
  • Ajuste parcial: congelar bloques bajos, entrenar los altos junto con la cabecera.

Auto-supervisión: un profesor sin etiquetas

Las tareas pretextos engañan a la red para que aprenda estructura: predicción de rompecabezas, modelo de relleno (inpainting) o, en la familia MAE, enmascarar parches de la imagen y reconstruirlos. La línea contrastiva —SimCLR, MoCo— aprende de dos vistas aumentadas de la misma imagen: cerca en el espacio latente lo que coincide, lejos lo que no. DINO y su segundo acto produjeron atenciones que ya segmentan objetos sin una sola caja.

CLIP: el puente con el lenguaje

Al entrenar una imagen y su descripción para que se encuentren en un espacio común, CLIP hereda una capacidad inesperada: clasificar por lenguaje. Se le puede pedir "foto de un refractómetro industrial" sin haber visto nunca esa clase: clasificación cero-shot con la lista de etiquetas como prompt.

Elegir la receta: presupuesto de datos

  • Cero etiquetas en la tarea: backbone auto-supervisado más prototipos o CLIP.
  • Decenas por clase: extractor congelado con regularización fuerte.
  • Cientos por clase: fine-tuning parcial con aumentos agresivos.
  • Miles y dominio lejano: fine-tuning completo y validación que imite al despliegue.
La etiqueta es la moneda; cada receta gasta distinto.
RecetaPide / Entrega
Extractor congeladopocas etiquetas; rápida, techo bajo
Fine-tuningmás etiquetas; mejor precisión, más costo
Auto-supervisado previosin etiquetas de tarea; buen punto de partida
CLIP cero-shotninguna; flexibilidad de clase abierta

Errores frecuentes

  • Entrenar desde cero con 2 mil imágenes: sobreajuste garantizado.
  • Normalizar con la media del entrenamiento y sorprenderse del dominio real (brecha de dominio).
  • Aumentar con transformaciones que destruyen la etiqueta (giro de 90 grados en un histograma médico).
  • Usar el conjunto de validación para elegir la tasa de aprendizaje del fine-tuning: fuga silenciosa.

Ejemplo resuelto: detección de defectos con 800 imágenes etiquetadas

  1. Backbone auto-supervisado (DINO o MAE) en las 40 mil imágenes sin etiqueta de la planta.
  2. Cabecera de detección ligera sobre bloques altos, con los bloques bajos congelados.
  3. Aumentos que respetan la física: brillo, oclusión parcial, corte y rotaciones pequeñas.
  4. Validación con el lote del turno nocturno para medir brecha real.
  5. Iterar el etiquetado activo donde la incertidumbre del ensemble sea alta.

¿Para qué sirve en la realidad?

Inspección industrial, diagnóstico asistido, agro y sensores remotos comparten el mismo retrato: datos sobran, etiquetas escasean. La transferencia y la auto-supervisión son la razón por la que una startup con un smartphone compite en visión con quien tenía un dataset de millones.

¿Qué hace posible el aprendizaje auto-supervisado en visión?

En CLIP, las clases que se pueden reconocer en cero-shot deben haber aparecido en el entrenamiento del modelo.

La familia de métodos que aprende de dos vistas aumentadas de la misma imagen se llama aprendizaje .

Clasifica cada técnica según el presupuesto de datos que presupone.

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada método con su idea central.

      Transferencia visual

      Congelar el backbone y entrenar la cabecera
      extracción de características
      Desplegar toda la red con tasa pequeña
      fine-tuning
      Supervisión desde la propia imagen
      auto-supervisado
      Clasificar con descripciones de texto
      CLIP cero-shot
      Diferencia entre dominios al inferir
      brecha de dominio

      Toca una tarjeta para ver la respuesta.

      Transferencia visual

      • Transferencia y auto-supervisión
        • Por qué
          • rasgos compartidos
            • costo de etiquetas
            • Recetas
              • congelar backbone
                • ajuste fino
                  • parcial
                  • Auto-supervisado
                    • MAE
                      • contrastivo
                        • DINO
                        • CLIP
                          • cero-shot
                            • por lenguaje

                          Para clasificar cinco tipos de defecto en piezas tienes 900 fotos etiquetadas y 50 mil sin anotar. Argumenta la ruta de transferencia que elegirías (qué congelas, qué ajustas, qué aumentos usas) y cómo medirías la brecha entre tu validación y la línea de producción real.

                          Tu texto se guarda sólo en este dispositivo.

                          Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                          Autoevaluación

                          Comprueba lo que aprendiste

                          2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                          Iniciar autoevaluación
                          Más sobre esta lección

                          Llegaste aquí desde otro camino. Puedes seguir aquí el tiempo que quieras.

                          Volver a «Segmentación semántica»

                          Rutas vivas

                          ¿Y ahora qué? Elige el camino por lo que necesitas

                          No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                          Otra forma de comprenderlo

                          ✦ Explorar el universo completo
                          Explora temas relacionados

                          Conceptos

                          Comentarios

                          Inicia sesión para comentar.

                          Todavía no hay comentarios. Sé la primera persona en opinar.