Temario del curso
Infraestructura de EXO como código
- Descripción de los patrones de despliegue de EXO: clústeres de un solo nodo, multi-nodos y con RDMA
- Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) mediante gestión de configuraciones.
- Uso de Nix flakes para crear construcciones reproducibles y entornos de desarrollo en EXO.
- Elaboración de playbooks de Ansible o scripts shell destinados a la instalación automática del clúster.
Construcción reproducible e integración con CI
- Establecimiento de versiones fijas para las dependencias y construcción del panel de control dentro de pipelines CI.
- Ejecución de pruebas iniciales de EXO mediante GitHub Actions o GitLab CI runners.
- Generación de imágenes maestras así como flujos de trabajo para la recuperación a partir de snapshots en máquinas virtuales macOS y Linux.
- Gestión conjunta de tarjetas modelo personalizadas junto con el código fuente de las aplicaciones.
Detección del clúster y automatización de la red
- Configuración de mDNS y DNS estático para permitir la localización precisa de nodos libp2p.
- Automatización en macOS relativa a la creación de perfiles de red así como la gestión de puentes Thunderbolt.
- Utilización de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para distinguir entornos de desarrollo, pruebas y producción.
- Diseño de reglas de firewall así como segmentación lógica de redes en escenarios con múltiples clientes.
Almacenamiento y gestión del ciclo de vida de los modelos
- Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS.
- Montaje de recursos compartidos NFS o SAN en modo solo lectura como repositorios de modelos, lo cual acelera el aprovisionamiento del clúster.
- Limpieza automática de cachés obsoletas y establecimiento de políticas para conservar versiones previas de pesos.
- Automatización previa a las actualizaciones: descarga anticipada de modelos así como validación de su estado funcional.
Monitorización y alertas
- Envío automático de registros EXO a sistemas centralizados tales como ELK, Loki o Splunk.
- Diseño de paneles visuales en Grafana basándose en la información generada por EXO_TRACING_ENABLED.
- Notificación instantánea ante variaciones en la composición del clúster, eventos de falta de memoria o incrementos bruscos en los tiempos de inferencia.
- Conexión entre telemetría hardware macmon y posibles caídas de rendimiento de los modelos utilizados.
Actualizaciones, recuperación ante errores y planificación en caso de desastre
- Prueba preliminar de nuevas versiones binarias de EXO mediante nodos canario antes del despliegue a todo el entorno.
- Recuperación inmediata en el nivel del modelo: cambios entre diferentes configuraciones cuantizadas sin necesidad de volver a realizar descargas completas.
- Copia de seguridad y posterior restauración del estado del clúster, nombres espacios creados así como memorización local de pesos previsados.
- Elaboración previa de guías operativas destinadas a reconstrucciones totales del clúster ante contingencias no anticipadas.
Fortalecimiento de la seguridad y cumplimiento normativo
- Aplicación de cifrado TLS mediante proxies inversos (nginx, traefik) en el panel de control y servicios API.
- Limitación estricta del uso de las APIs y bloqueo automático ante IPs no autorizadas para la comunicación con los puntos finales EXO.
- Separación física y lógica mediante VLANs así como aplicación de políticas de acceso tipo “cero confianza”.
- Registro constante de accesos efectuados junto con listado detallado de modelos desplegados e identificaciones asociadas a cada versión.
Requerimientos
- Experiencia previa con metodologías DevOps (CI/CD, IaC y orquestación de contenedores)
- Conocimientos básicos en administración de sistemas y gestión de paquetes en macOS o Linux
- Comprensión de conceptos relacionados con redes, DNS y almacenamiento
Público objetivo
- Ingenieros DevOps
- Arquitectos de infraestructuras
- Ingenieros SRE responsables del despliegue y gestión de cargas de trabajo de IA en entornos locales
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 4350 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (2)
El conocimiento y experiencia del consultor ya que se abordan los temas teóricos aplicándolos a la realidad de los procesos. El curso contiene un programa de mucho valor en la gestión de las tecnologías de información.
Luis Castro Gamboa - Cooperativa De Ahorro Y Credito Ande No. 1 R.L.
Curso - Site Reliability Engineering (SRE) Foundation®
Que fue muy claro en cada especificación