Solicitar información

Temario del curso

Introducción a la capacidad multimodal de Gemini 3

  • Posibilidades del modelo en relación con texto, imágenes, audio y vídeo
  • Selección del modelo adecuado y descripción de los puntos de conexión disponibles
  • Conceptos fundamentales sobre el razonamiento multimodal

Trabajo con texto e indicaciones estructuradas

  • Estrategias para formular indicaciones destinadas a la generación de texto
  • Uso adecuado de metadatos, ventanas de contexto y representaciones numéricas del texto
  • Organización de tareas multimodales mediante instrucciones textuales

Comprensión visual e implementación de flujos de trabajo basados en imágenes

  • Análisis y descripción detallada de imágenes mediante Gemini 3
  • Desarrollo de herramientas para la búsqueda visual y etiquetado automático
  • Creación de interacciones que permitan convertir texto en imágenes y viceversa

Procesamiento de entradas auditivas

  • Flujos de trabajo para el reconocimiento del habla y la transcripción de audio
  • Detección e interpretación de eventos sonoros mediante Gemini 3
  • Integración del contenido auditivo con información textual y visual

Análisis inteligente de vídeos e identificación de escenas

  • Procesamiento secuencial y continuo del contenido audiovisual por parte del modelo
  • Elaboración de herramientas destinadas a resumir vídeos o extraer momentos clave
  • Automatización de tareas basadas en contenido visual y temporal

Diseño de arquitecturas para aplicaciones multimodales

  • Integración de diversos tipos de entradas dentro del mismo flujo de trabajo
  • Consideraciones clave en materia de latencia, costes y recursos computacionales necesarios
  • Prácticas recomendadas para desarrollar sistemas multimodales escalables

Creación práctica de prototipos aplicativos multimodales

  • Desarrollo activo de prototipos con capacidades múltiples de entrada y salida
  • Iteración rápida a través del perfeccionamiento continuo de las indicaciones utilizadas
  • Verificación y refinamiento de la experiencia general ofrecida al usuario final

Implementación definitiva de soluciones multimodales

  • Planes de despliegue efectivos y configuración del entorno operativo correspondiente
  • Supervisión constante del rendimiento real obtenido por la aplicación desplegada
  • Análisis exhaustivo de aspectos de seguridad y cumplimiento normativo relevantes

Conclusión e itinerarios a seguir en adelante

Requerimientos

  • Comprensión de los conceptos básicos de la inteligencia artificial moderna
  • Experiencia previa con Python o JavaScript
  • Conocimiento general sobre APIs REST

Público objetivo

  • Diseñadores
  • Creadores de contenido
  • Equipos técnicos de producto
 14 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 2900 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Reseñas (1)

Próximos cursos

Categorías Relacionadas