Solicitar información
 Duración 35 horas

Temario del curso

Introducción, objetivos y estrategia de migración

  • Objetivos del curso, alineación con el perfil del participante y criterios de éxito
  • Enfoques de migración de alto nivel y consideraciones de riesgos
  • Configuración de espacios de trabajo, repositorios y conjuntos de datos de laboratorio

Día 1 — Fundamentos de migración y arquitectura

  • Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks
  • Diferencias entre SMP y MPP y sus implicaciones para la migración
  • Diseño Medallion (Bronze → Silver → Gold) y visión general de Unity Catalog

Laboratorio del Día 1 — Traducción de un procedimiento almacenado

  • Migración práctica de un procedimiento almacenado de ejemplo a un notebook
  • Mapeo de tablas temporales y cursores a transformaciones de DataFrame
  • Validación y comparación con la salida original

Día 2 — Delta Lake avanzado y carga incremental

  • Transacciones ACID, registros de compromiso, versiones y viaje en el tiempo
  • Auto Loader, patrones MERGE INTO, inserciones actualizadas (upserts) y evolución de esquemas
  • OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento

Laboratorio del Día 2 — Ingesta incremental y optimización

  • Implementación de la ingesta con Auto Loader y flujos de trabajo MERGE
  • Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
  • Medición de las mejoras en el rendimiento de lectura/escritura

Día 3 — SQL en Databricks, rendimiento y depuración

  • Funcionalidades de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays
  • Lectura de la interfaz de usuario de Spark, DAGs, barajados (shuffles), etapas, tareas y diagnóstico de cuellos de botella
  • Patrones de ajuste de consultas: uniones por difusión (broadcast), indicaciones (hints), caché y reducción de vertidos (spill)

Laboratorio del Día 3 — Refactorización de SQL y ajuste de rendimiento

  • Refactorizar un proceso SQL pesado en Spark SQL optimizado
  • Utilizar trazas de la interfaz de usuario de Spark para identificar y corregir problemas de sesgo (skew) y barajados
  • Realizar pruebas de rendimiento (benchmark) antes y después, y documentar los pasos de ajuste

Día 4 — PySpark táctico: Reemplazando la lógica procedural

  • Modelo de ejecución de Spark: controlador, ejecutores, evaluación perezosa y estrategias de particionamiento
  • Transformación de bucles y cursores en operaciones vectorizadas de DataFrame
  • Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables

Laboratorio del Día 4 — Refactorización de scripts procedurales

  • Refactorizar un script ETL procedural en notebooks de PySpark modulares
  • Introducir parametrización, pruebas de estilo unitario y funciones reutilizables
  • Revisión de código y aplicación de la lista de verificación de mejores prácticas

Día 5 — Orquestación, pipeline de principio a fin y mejores prácticas

  • Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenadores y manejo de errores
  • Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquemas
  • Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para la lógica de PySpark

Laboratorio del Día 5 — Construir un pipeline completo de principio a fin

  • Ensamblar el pipeline Bronze → Silver → Gold orquestado con Workflows
  • Implementar registro de eventos (logging), auditoría, reintentos y validaciones automatizadas
  • Ejecutar el pipeline completo, validar las salidas y preparar las notas de despliegue

Operacionalización, gobernanza y preparación para producción

  • Gobernanza con Unity Catalog, linaje y mejores prácticas de controles de acceso
  • Costos, dimensionamiento de clústeres, escalado automático y patrones de concurrencia de trabajos
  • Listas de verificación de despliegue, estrategias de reversión y creación de guiones de operación (runbooks)

Revisión final, transferencia de conocimientos y próximos pasos

  • Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas
  • Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de formación
  • Referencias, rutas de aprendizaje adicional y opciones de soporte

Requerimientos

  • Comprensión de los conceptos de ingeniería de datos
  • Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
  • Familiaridad con conceptos de orquestación ETL (ADF o similar)

Público objetivo

  • Gestores de tecnología con experiencia en ingeniería de datos
  • Ingenieros de datos que transicionan la lógica procedural OLAP a patrones de Lakehouse
  • Ingenieros de plataforma responsables de la adopción de Databricks

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 7250 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Reseñas (1)

Próximos cursos

Categorías Relacionadas