Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Fundamentos del despliegue de Tencent Hunyuan en producción
- Descripción general de los escenarios de despliegue de modelos de Tencent Hunyuan
- Características propias de los modelos grandes y basados en Mixture of Experts en entornos productivos
- Puntos críticos respecto a latencia, rendimiento y costos
- Cómo definir objetivos operativos para cargas de inferencia
Arquitectura de despliegue y flujo de trabajo de inferencia
- Componentes principales de una infraestructura productiva para inferencia
- Opciones de despliegue: mediante contenedores, en instalaciones propias o en la nube
- Básicos sobre carga del modelo, direccionamiento de solicitudes y asignación eficiente de GPUs
- Principios para lograr robustez y sencillez operativa
Optimización práctica de la latencia
- Uso de motores de inferencia optimizados como TensorRT cuando resulte oportuno
- Conceptos del caché KV y recomendaciones para su ajuste eficaz
- Métodos para reducir el tiempo de inicio, calentamiento y demora en la respuesta
- Cómo medir el tiempo hasta recibir el primer token generado y la velocidad de producción de tokens
Rendimiento, agrupación de solicitudes y eficiencia en uso de GPUs
- Estrategias de agrupamiento continuo y por lotes para gestionar múltiples solicitudes
- Manejo adecuado de la concurrencia y comportamiento de colas de espera
- Técnicas para aumentar el aprovechamiento de GPUs sin afectar negativamente la experiencia del usuario
- Abordaje eficiente de solicitudes que requieren contextos extensos o mezclan distintos tipos de demanda
Cuantización y gestión racional de costos
- Importancia fundamental de la cuantización en el despliegue productivo
- Evaluación de las ventajas e inconvenientes relativos a los formatos FP16, INT8 y otras precisiones comunes
- Cómo equilibrar calidad del modelo, latencia y gastos de infraestructura
- Elaboración de una lista sencilla para optimizar costos en producción
Operaciones, supervisión técnica y evaluación preliminar
- Mecanismos que activan el escalado automático de servicios de inferencia
- Parámetros esenciales a monitorear: latencia, volumen de solicitudes, uso del caché y salud operativa de las GPUs
- Principios básicos de registro de datos, generación de alertas y respuesta ante incidentes
- Análisis de un ejemplo real de despliegue y creación de un plan orientado al perfeccionamiento continuo
Requerimientos
- Conocimientos básicos sobre el despliegue de modelos de lenguaje grande y los flujos de trabajo de inferencia
- Experiencia en el uso de contenedores, infraestructuras en la nube o locales, así como servicios basados en API
- Conocimiento práctico del lenguaje Python o tareas relacionadas con ingeniería de sistemas
Público objetivo
- Ingenieros de Machine Learning que implementan modelos de lenguaje grande en producción
- Ingenieros de plataformas responsables del despliegue de servicios de inferencia con GPUs
- Arquitectos de soluciones dedicados al diseño de plataformas escalables para el servicio de IA
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 2900 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales