Solicitar información

Temario del curso

Introducción a las tecnologías de reconocimiento del habla

  • Historia y evolución del reconocimiento del habla.
  • Modelos acústicos, modelos lingüísticos y mecanismos de decodificación.
  • Arquitecturas modernas: redes recurrentes, transformadores y Whisper.

Preprocesamiento del audio y fundamentos de la transcripción

  • Manejo de distintos formatos y frecuencias de muestreo de audio.
  • Limpieza, recorte y segmentación del material audio.
  • Generación de texto a partir del audio: procesamiento en tiempo real o por lotes.

Práctica con Whisper y otras API

  • Instalación y uso práctico de OpenAI Whisper.
  • Uso de APIs en la nube como las de Google o Azure para la transcripción del habla.
  • Comparativa entre rendimiento, latencia y costos asociados a cada herramienta.

Manejo de múltiples idiomas, acentos y contextos especializados

  • Trabajo con distintos idiomas y variantes dialectales.
  • Personalización del vocabulario y mejora de la tolerancia al ruido ambiental.
  • Aplicación a ámbitos como el jurídico, médico o técnico.

Formateo de resultados y su integración en sistemas

  • Incorporación de marcas temporales, puntuación y etiquetas que identifiquen a los hablantes.
  • Exportación del texto transcrito en formatos como TXT, SRT o JSON.
  • Integración de las transcripciones con aplicaciones o bases de datos existentes.

Laboratorios prácticos orientados a casos de uso reales

  • Transcripción de reuniones, entrevistas o podcasts.
  • Desarrollo de sistemas que conviertan el habla en comandos ejecutables.
  • Creación de subtítulos en tiempo real para vídeos y contenido audio.

Evaluación, limitaciones éticas y consideraciones generales

  • Métricas de precisión y técnicas para evaluar el rendimiento de los modelos.
  • Cuestiones relativas a sesgos, equidad e impacto social en los modelos del habla.
  • Aspectos relacionados con la privacidad y el cumplimiento normativo.

Resumen final y recomendaciones para seguir avanzando

Requerimientos

  • Conocimientos básicos sobre los conceptos generales de la inteligencia artificial y el aprendizaje automático.
  • Familiaridad con formatos y herramientas relacionadas con archivos de audio o multimedia.

Público objetivo

  • Científicos de datos e ingenieros especializados en IA que trabajen con datos de voz.
  • Desarrolladores de software interesados en crear aplicaciones basadas en transcripción automática.
  • Organizaciones que estén explorando el uso del reconocimiento del habla para automatizar procesos.
 14 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 2900 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Próximos cursos

Categorías Relacionadas