Solicitar información

Temario del curso

Introducción a los modelos visión-lenguaje

  • Descripción general de los VLM y su papel dentro de la IA multimodal
  • Arquitecturas destacadas: CLIP, Flamingo, BLIP, entre otras.
  • Aplicaciones prácticas: búsqueda, generación de descripciones, sistemas autónomos y análisis de contenidos

Preparación del entorno para el ajuste fino

  • Configuración de OpenCLIP y otras bibliotecas VLM pertinentes.
  • Formatos adecuados para conjuntos de datos con pares imagen-texto.
  • Pipelines de preprocesamiento dirigidos a entradas visuales y textuales.

Ajuste fino de CLIP y modelos similares

  • Funcionamiento del error de contraste y generación de espacios de incrustación conjuntos.
  • Practicando: ajuste fino de CLIP con conjuntos de datos propios.
  • Manejo de datos multilingües o pertenecientes a dominios específicos.

Técnicas avanzadas en el ajuste fino

  • Uso de métodos como LoRA y adaptadores para aumentar la eficiencia.
  • Ajustes mediante indicaciones textuales o inyección de señales visuales.
  • Comparación entre evaluación con modelo preentrenado y tras ajuste fino.

Evaluación y establecimiento de referencias

  • Métricas utilizadas en los modelos VLM: precisión en recuperación, BLEU, CIDEr y tasa de aciertos.
  • Diagnóstico del grado de alineación entre contenido visual y textual.
  • Representación gráfica de espacios de incrustación y posibles errores en clasificaciones.

Implementación práctica y uso real

  • Exportación de modelos listos para inferencia (formato TorchScript u ONNX).
  • Integración de VLM en sistemas productivos o servicios web.
  • Consideraciones sobre el consumo de recursos y la escalabilidad del modelo.

Estudios de caso y escenarios aplicados

  • Análisis mediático y moderación de contenidos digitales.
  • Búsquedas y recuperación información en comercio electrónico y bibliotecas virtuales.
  • Interacción multimodal empleada en robótica y sistemas autónomos.

Resumen final y perspectivas futuras

Requerimientos

  • Conocimientos básicos sobre aprendizaje profundo aplicado a visión por computadora y procesamiento del lenguaje natural
  • Experiencia previa con PyTorch y modelos basados en transformadores
  • Familiaridad con las arquitecturas de los modelos multimodales

Público objetivo

  • Ingenieros de visión por computadora
  • Desarrolladores de inteligencia artificial
 14 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 2900 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Próximos cursos

Categorías Relacionadas