Solicitar información

Temario del curso

Introducción a la síntesis del habla y la clonación de voces

  • Descripción general sobre la síntesis de texto a voz (TTS) y los modelos neuronales para producir voces
  • Diferencias entre clonación de voz y generación del habla: casos de uso y límites prácticos
  • Principales modelos utilizados: Tacotron, WaveNet, FastSpeech, VITS

Trabajo con plataformas comerciales

  • Utilización de ElevenLabs y Resemble AI para crear y manipular voces
  • Creación, clonación y edición de voces en entornos profesionales
  • Uso de APIs para integrar sistemas TTS en proyectos diversos

Desarrollo mediante herramientas de código abierto

  • Instalación y configuración de Coqui TTS para entornos personalizados
  • Entrenamiento de modelos vocales propios y gestión eficiente de conjuntos de datos
  • Generación controlada del habla: ajuste de tono, velocidad y expresividad emocional

Preparación de datos y gestión de colecciones vocales

  • Recopilación y depuración adecuada de muestras vocales
  • Segmentación, etiquetado y sincronización precisa de transcripciones
  • Aspectos éticos en la obtención de permisos y autorizaciones para el uso de voces

Integración con otras aplicaciones y sistemas

  • Incorporación práctica de motores TTS en páginas web y programas informáticos
  • Implementación de sistemas IVR y bots interactivos basados en voz
  • Creación de diálogos artificiales para producciones audiovisuales o videojuegos

Evaluación de calidad y nivel de realismo del habla generada

  • Medición a través de la puntuación subjetiva promedio (MOS) y análisis de claridad verbal
  • Control fino sobre matices expresivos y características prosódicas del discurso
  • Comparativa entre distintos modelos según latencia, precisión técnica y apariencia natural

Consideraciones éticas, legales y de gobernanza relacionadas con el uso de esta tecnología

  • Riesgos potenciales derivados del uso indebido de “deepfakes” y buenas prácticas para su aplicación responsable
  • Importancia fundamental del consentimiento previo, reconocimiento adecuado así como el cumplimiento estricto de derechos de autor
  • Marco regulatorio vigente y políticas corporativas que guían la implementación segura de dichas tecnologías

Resumen final y recomendaciones para el desarrollo futuro en este ámbito

Requerimientos

  • Conocimientos básicos sobre conceptos fundamentales del aprendizaje automático
  • Familiaridad con formatos de archivos de audio y herramientas de edición
  • Habilidades básicas en programación con Python

Público objetivo

  • Desarrolladores e ingenieros de IA interesados en la síntesis del habla
  • Creadores de contenido y especialistas en tecnología multimedia que deseen explorar nuevas técnicas de generación vocal
  • Equipos de investigación y desarrollo enfocados en la creación de sistemas de audio personalizados o dinámicos
 14 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 2900 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Próximos cursos

Categorías Relacionadas