Temario del curso
Introducción a la capacidad multimodal de Gemini 3
- Posibilidades del modelo en relación con texto, imágenes, audio y vídeo
- Selección del modelo adecuado y descripción de los puntos de conexión disponibles
- Conceptos fundamentales sobre el razonamiento multimodal
Trabajo con texto e indicaciones estructuradas
- Estrategias para formular indicaciones destinadas a la generación de texto
- Uso adecuado de metadatos, ventanas de contexto y representaciones numéricas del texto
- Organización de tareas multimodales mediante instrucciones textuales
Comprensión visual e implementación de flujos de trabajo basados en imágenes
- Análisis y descripción detallada de imágenes mediante Gemini 3
- Desarrollo de herramientas para la búsqueda visual y etiquetado automático
- Creación de interacciones que permitan convertir texto en imágenes y viceversa
Procesamiento de entradas auditivas
- Flujos de trabajo para el reconocimiento del habla y la transcripción de audio
- Detección e interpretación de eventos sonoros mediante Gemini 3
- Integración del contenido auditivo con información textual y visual
Análisis inteligente de vídeos e identificación de escenas
- Procesamiento secuencial y continuo del contenido audiovisual por parte del modelo
- Elaboración de herramientas destinadas a resumir vídeos o extraer momentos clave
- Automatización de tareas basadas en contenido visual y temporal
Diseño de arquitecturas para aplicaciones multimodales
- Integración de diversos tipos de entradas dentro del mismo flujo de trabajo
- Consideraciones clave en materia de latencia, costes y recursos computacionales necesarios
- Prácticas recomendadas para desarrollar sistemas multimodales escalables
Creación práctica de prototipos aplicativos multimodales
- Desarrollo activo de prototipos con capacidades múltiples de entrada y salida
- Iteración rápida a través del perfeccionamiento continuo de las indicaciones utilizadas
- Verificación y refinamiento de la experiencia general ofrecida al usuario final
Implementación definitiva de soluciones multimodales
- Planes de despliegue efectivos y configuración del entorno operativo correspondiente
- Supervisión constante del rendimiento real obtenido por la aplicación desplegada
- Análisis exhaustivo de aspectos de seguridad y cumplimiento normativo relevantes
Conclusión e itinerarios a seguir en adelante
Requerimientos
- Comprensión de los conceptos básicos de la inteligencia artificial moderna
- Experiencia previa con Python o JavaScript
- Conocimiento general sobre APIs REST
Público objetivo
- Diseñadores
- Creadores de contenido
- Equipos técnicos de producto
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 2900 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (1)
Flujo, vibra y tema en la presentación
Lukasz Kowalczyk - Allegro Sp. z o.o.
Curso - Google Gemini AI for Data Analysis
Traducción Automática