Solicitar información

Temario del curso

Introducción a la inteligencia artificial multimodal y Ollama

  • Descripción general del aprendizaje multimodal
  • Principales desafíos en la integración entre visión y lenguaje
  • Capacidades técnicas y arquitectura de Ollama

Configuración del entorno de trabajo con Ollama

  • Instalación y configuración básica de Ollama
  • Trabajo con la implementación local de modelos
  • Integración de Ollama con Python y Jupyter

Trabajando con entradas multimodales

  • Combinación de texto e imágenes en un mismo flujo de datos
  • Incorporación de datos sonoros y estructurados en los modelos<\/li>
  • Diseño de pipelines para el preprocesamiento de información multimodales

Aplicaciones orientadas a la comprensión documental

  • Extracción de datos estructurados a partir de PDFs e imágenes
  • Uso conjunto del reconocimiento óptico de caracteres y modelos lingüísticos
  • Diseño de flujos automatizados para el análisis inteligente de documentos

Respuesta a preguntas basadas en imágenes (VQA)

  • Configuración de conjuntos de datos y referencias comparativas para VQA
  • Entrenamiento, validación y evaluación de modelos multimodales
  • Creación de aplicaciones interactivas basadas en la comprensión visual y textual<\/li>

Diseño de agentes multimodales avanzados

  • Conceptos clave al diseñar agentes que realicen razonamientos basados en múltiples tipos de datos
  • Síntesis entre procesamiento visual, comprensión del lenguaje y acciones programadas
  • Implementación práctica de estos agentes en escenarios reales

Integración avanzada y optimización de modelos

  • Ajuste fino de modelos multimodales mediante Ollama
  • Optimización del rendimiento durante la inferencia de datos
  • Consideraciones prácticas en cuanto a escalabilidad e implementación

Resumen y próximos pasos

Requerimientos

  • Sólido conocimiento de los conceptos fundamentales del aprendizaje automático
  • Experiencia previa con frameworks de deep learning como PyTorch o TensorFlow
  • Dominio básico en procesamiento del lenguaje natural y visión por computadora

Público objetivo

  • Ingenieros especializados en aprendizaje automático
  • Investigadores en inteligencia artificial
  • Desarrolladores de productos que integran flujos de trabajo visuales y textuales
 21 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 4350 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Próximos cursos

Categorías Relacionadas