Solicitar información

Temario del curso

Fundamentos del despliegue de Tencent Hunyuan en producción

  • Descripción general de los escenarios de despliegue de modelos de Tencent Hunyuan
  • Características propias de los modelos grandes y basados en Mixture of Experts en entornos productivos
  • Puntos críticos respecto a latencia, rendimiento y costos
  • Cómo definir objetivos operativos para cargas de inferencia

Arquitectura de despliegue y flujo de trabajo de inferencia

  • Componentes principales de una infraestructura productiva para inferencia
  • Opciones de despliegue: mediante contenedores, en instalaciones propias o en la nube
  • Básicos sobre carga del modelo, direccionamiento de solicitudes y asignación eficiente de GPUs
  • Principios para lograr robustez y sencillez operativa

Optimización práctica de la latencia

  • Uso de motores de inferencia optimizados como TensorRT cuando resulte oportuno
  • Conceptos del caché KV y recomendaciones para su ajuste eficaz
  • Métodos para reducir el tiempo de inicio, calentamiento y demora en la respuesta
  • Cómo medir el tiempo hasta recibir el primer token generado y la velocidad de producción de tokens

Rendimiento, agrupación de solicitudes y eficiencia en uso de GPUs

  • Estrategias de agrupamiento continuo y por lotes para gestionar múltiples solicitudes
  • Manejo adecuado de la concurrencia y comportamiento de colas de espera
  • Técnicas para aumentar el aprovechamiento de GPUs sin afectar negativamente la experiencia del usuario
  • Abordaje eficiente de solicitudes que requieren contextos extensos o mezclan distintos tipos de demanda

Cuantización y gestión racional de costos

  • Importancia fundamental de la cuantización en el despliegue productivo
  • Evaluación de las ventajas e inconvenientes relativos a los formatos FP16, INT8 y otras precisiones comunes
  • Cómo equilibrar calidad del modelo, latencia y gastos de infraestructura
  • Elaboración de una lista sencilla para optimizar costos en producción

Operaciones, supervisión técnica y evaluación preliminar

  • Mecanismos que activan el escalado automático de servicios de inferencia
  • Parámetros esenciales a monitorear: latencia, volumen de solicitudes, uso del caché y salud operativa de las GPUs
  • Principios básicos de registro de datos, generación de alertas y respuesta ante incidentes
  • Análisis de un ejemplo real de despliegue y creación de un plan orientado al perfeccionamiento continuo

Requerimientos

  • Conocimientos básicos sobre el despliegue de modelos de lenguaje grande y los flujos de trabajo de inferencia
  • Experiencia en el uso de contenedores, infraestructuras en la nube o locales, así como servicios basados en API
  • Conocimiento práctico del lenguaje Python o tareas relacionadas con ingeniería de sistemas

Público objetivo

  • Ingenieros de Machine Learning que implementan modelos de lenguaje grande en producción
  • Ingenieros de plataformas responsables del despliegue de servicios de inferencia con GPUs
  • Arquitectos de soluciones dedicados al diseño de plataformas escalables para el servicio de IA
 14 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 2900 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Próximos cursos

Categorías Relacionadas