Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a las tecnologías de reconocimiento del habla
- Historia y evolución del reconocimiento del habla.
- Modelos acústicos, modelos lingüísticos y mecanismos de decodificación.
- Arquitecturas modernas: redes recurrentes, transformadores y Whisper.
Preprocesamiento del audio y fundamentos de la transcripción
- Manejo de distintos formatos y frecuencias de muestreo de audio.
- Limpieza, recorte y segmentación del material audio.
- Generación de texto a partir del audio: procesamiento en tiempo real o por lotes.
Práctica con Whisper y otras API
- Instalación y uso práctico de OpenAI Whisper.
- Uso de APIs en la nube como las de Google o Azure para la transcripción del habla.
- Comparativa entre rendimiento, latencia y costos asociados a cada herramienta.
Manejo de múltiples idiomas, acentos y contextos especializados
- Trabajo con distintos idiomas y variantes dialectales.
- Personalización del vocabulario y mejora de la tolerancia al ruido ambiental.
- Aplicación a ámbitos como el jurídico, médico o técnico.
Formateo de resultados y su integración en sistemas
- Incorporación de marcas temporales, puntuación y etiquetas que identifiquen a los hablantes.
- Exportación del texto transcrito en formatos como TXT, SRT o JSON.
- Integración de las transcripciones con aplicaciones o bases de datos existentes.
Laboratorios prácticos orientados a casos de uso reales
- Transcripción de reuniones, entrevistas o podcasts.
- Desarrollo de sistemas que conviertan el habla en comandos ejecutables.
- Creación de subtítulos en tiempo real para vídeos y contenido audio.
Evaluación, limitaciones éticas y consideraciones generales
- Métricas de precisión y técnicas para evaluar el rendimiento de los modelos.
- Cuestiones relativas a sesgos, equidad e impacto social en los modelos del habla.
- Aspectos relacionados con la privacidad y el cumplimiento normativo.
Resumen final y recomendaciones para seguir avanzando
Requerimientos
- Conocimientos básicos sobre los conceptos generales de la inteligencia artificial y el aprendizaje automático.
- Familiaridad con formatos y herramientas relacionadas con archivos de audio o multimedia.
Público objetivo
- Científicos de datos e ingenieros especializados en IA que trabajen con datos de voz.
- Desarrolladores de software interesados en crear aplicaciones basadas en transcripción automática.
- Organizaciones que estén explorando el uso del reconocimiento del habla para automatizar procesos.
14 Horas
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 2900 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales