Temario del curso
Introducción a la síntesis del habla y la clonación de voces
- Descripción general sobre la síntesis de texto a voz (TTS) y los modelos neuronales para producir voces
- Diferencias entre clonación de voz y generación del habla: casos de uso y límites prácticos
- Principales modelos utilizados: Tacotron, WaveNet, FastSpeech, VITS
Trabajo con plataformas comerciales
- Utilización de ElevenLabs y Resemble AI para crear y manipular voces
- Creación, clonación y edición de voces en entornos profesionales
- Uso de APIs para integrar sistemas TTS en proyectos diversos
Desarrollo mediante herramientas de código abierto
- Instalación y configuración de Coqui TTS para entornos personalizados
- Entrenamiento de modelos vocales propios y gestión eficiente de conjuntos de datos
- Generación controlada del habla: ajuste de tono, velocidad y expresividad emocional
Preparación de datos y gestión de colecciones vocales
- Recopilación y depuración adecuada de muestras vocales
- Segmentación, etiquetado y sincronización precisa de transcripciones
- Aspectos éticos en la obtención de permisos y autorizaciones para el uso de voces
Integración con otras aplicaciones y sistemas
- Incorporación práctica de motores TTS en páginas web y programas informáticos
- Implementación de sistemas IVR y bots interactivos basados en voz
- Creación de diálogos artificiales para producciones audiovisuales o videojuegos
Evaluación de calidad y nivel de realismo del habla generada
- Medición a través de la puntuación subjetiva promedio (MOS) y análisis de claridad verbal
- Control fino sobre matices expresivos y características prosódicas del discurso
- Comparativa entre distintos modelos según latencia, precisión técnica y apariencia natural
Consideraciones éticas, legales y de gobernanza relacionadas con el uso de esta tecnología
- Riesgos potenciales derivados del uso indebido de “deepfakes” y buenas prácticas para su aplicación responsable
- Importancia fundamental del consentimiento previo, reconocimiento adecuado así como el cumplimiento estricto de derechos de autor
- Marco regulatorio vigente y políticas corporativas que guían la implementación segura de dichas tecnologías
Resumen final y recomendaciones para el desarrollo futuro en este ámbito
Requerimientos
- Conocimientos básicos sobre conceptos fundamentales del aprendizaje automático
- Familiaridad con formatos de archivos de audio y herramientas de edición
- Habilidades básicas en programación con Python
Público objetivo
- Desarrolladores e ingenieros de IA interesados en la síntesis del habla
- Creadores de contenido y especialistas en tecnología multimedia que deseen explorar nuevas técnicas de generación vocal
- Equipos de investigación y desarrollo enfocados en la creación de sistemas de audio personalizados o dinámicos
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 2900 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales