Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a los modelos visión-lenguaje
- Descripción general de los VLM y su papel dentro de la IA multimodal
- Arquitecturas destacadas: CLIP, Flamingo, BLIP, entre otras.
- Aplicaciones prácticas: búsqueda, generación de descripciones, sistemas autónomos y análisis de contenidos
Preparación del entorno para el ajuste fino
- Configuración de OpenCLIP y otras bibliotecas VLM pertinentes.
- Formatos adecuados para conjuntos de datos con pares imagen-texto.
- Pipelines de preprocesamiento dirigidos a entradas visuales y textuales.
Ajuste fino de CLIP y modelos similares
- Funcionamiento del error de contraste y generación de espacios de incrustación conjuntos.
- Practicando: ajuste fino de CLIP con conjuntos de datos propios.
- Manejo de datos multilingües o pertenecientes a dominios específicos.
Técnicas avanzadas en el ajuste fino
- Uso de métodos como LoRA y adaptadores para aumentar la eficiencia.
- Ajustes mediante indicaciones textuales o inyección de señales visuales.
- Comparación entre evaluación con modelo preentrenado y tras ajuste fino.
Evaluación y establecimiento de referencias
- Métricas utilizadas en los modelos VLM: precisión en recuperación, BLEU, CIDEr y tasa de aciertos.
- Diagnóstico del grado de alineación entre contenido visual y textual.
- Representación gráfica de espacios de incrustación y posibles errores en clasificaciones.
Implementación práctica y uso real
- Exportación de modelos listos para inferencia (formato TorchScript u ONNX).
- Integración de VLM en sistemas productivos o servicios web.
- Consideraciones sobre el consumo de recursos y la escalabilidad del modelo.
Estudios de caso y escenarios aplicados
- Análisis mediático y moderación de contenidos digitales.
- Búsquedas y recuperación información en comercio electrónico y bibliotecas virtuales.
- Interacción multimodal empleada en robótica y sistemas autónomos.
Resumen final y perspectivas futuras
Requerimientos
- Conocimientos básicos sobre aprendizaje profundo aplicado a visión por computadora y procesamiento del lenguaje natural
- Experiencia previa con PyTorch y modelos basados en transformadores
- Familiaridad con las arquitecturas de los modelos multimodales
Público objetivo
- Ingenieros de visión por computadora
- Desarrolladores de inteligencia artificial
14 Horas
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 2900 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales