Temario del curso
Infraestructura como Código (IaC) para EXO
- Resumen de patrones de implementación de EXO: clústeres de nodo único, multinodo y RDMA
- Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuración
- Uso de Nix flakes para generar builds reproducibles de EXO y entornos de desarrollo
- Redacción de playbooks de Ansible o scripts shell para el aprovisionamiento no supervisado de clústeres
Generación de builds reproducibles e integración con CI
- Fijación de dependencias y construcción del dashboard en tuberías (pipelines) de CI
- Ejecución de pruebas básicas de EXO (smoke tests) en runners de GitHub Actions o GitLab CI
- Creación de imágenes base (golden images) y flujos de trabajo de reversión basados en instantáneas para VMs de macOS y Linux
- Versionado de tarjetas de modelos personalizados junto al código de la aplicación
Descubrimiento de clústeres y automatización de redes
- Configuración de mDNS y DNS estático para un descubrimiento fiable de nodos libp2p
- Automatización de la creación de perfiles de red y gestión del puente Thunderbolt en macOS
- Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción
- Reglas de firewall y segmentación de red para entornos multinatante
Gestión del almacenamiento y ciclo de vida de modelos
- Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS
- Montaje de comparticiones NFS o SAN como repositorios de solo lectura de modelos para un aprovisionamiento rápido
- Colección de elementos obsoletos (garbage collection) de cachés vencidos y políticas de retención de pesos versionados
- Automatización de la descarga previa de modelos y comprobaciones de estado antes de las actualizaciones progresivas
Supervisión y alertas
- Envío de logs de EXO a registro centralizado (ELK, Loki o Splunk)
- Creación de dashboards de Grafana a partir de la salida de EXO_TRACING_ENABLED
- Configuración de alertas ante cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia
- Correlación de la telemetría de hardware macmon con regresiones en el rendimiento de los modelos
Actualización, reversión y recuperación ante desastres
- Preparación de actualizaciones de binarios de EXO en un nodo canario antes de su despliegue masivo a toda la flota
- Reversión a nivel de modelo: cambio entre versiones cuantizadas sin volver a descargar los modelos
- Copia de seguridad y restauración del estado del clúster, espacios de nombres personalizados y pesos en caché
- Documentación de manuales de recuperación para escenarios de reconstrucción total del clúster
Endurecimiento de seguridad y cumplimiento normativo
- Aplicación de TLS en la capa de proxy inverso (nginx, traefik) para el dashboard y la API
- Implementación de limitación de velocidad de API (rate limiting) y lista blanca de IP para los puntos de conexión (endpoints) de EXO
- Aislamiento de clústeres mediante VLANs y políticas de red de confianza cero
- Auditoría de accesos y mantenimiento de un inventario de modelos desplegados y sus versiones
Requerimientos
- Experiencia con prácticas DevOps (CI/CD, IaC, orquestación de contenedores)
- Conocimiento de la administración del sistema y gestión de paquetes en macOS o Linux
- Comprensión de conceptos de redes, DNS y almacenamiento
Público objetivo
- Ingenieros DevOps
- Arquitectos de infraestructura
- SREs responsables de cargas de trabajo de IA on-premise
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 4350 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (2)
El conocimiento y experiencia del consultor ya que se abordan los temas teóricos aplicándolos a la realidad de los procesos. El curso contiene un programa de mucho valor en la gestión de las tecnologías de información.
Luis Castro Gamboa - Cooperativa De Ahorro Y Credito Ande No. 1 R.L.
Curso - Site Reliability Engineering (SRE) Foundation®
Que fue muy claro en cada especificación