Temario del curso
Introducción, objetivos y estrategia de migración
- Objetivos del curso, alineación con el perfil del participante y criterios de éxito
- Enfoques de migración de alto nivel y consideraciones de riesgos
- Configuración de espacios de trabajo, repositorios y conjuntos de datos de laboratorio
Día 1 — Fundamentos de migración y arquitectura
- Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks
- Diferencias entre SMP y MPP y sus implicaciones para la migración
- Diseño Medallion (Bronze → Silver → Gold) y visión general de Unity Catalog
Laboratorio del Día 1 — Traducción de un procedimiento almacenado
- Migración práctica de un procedimiento almacenado de ejemplo a un notebook
- Mapeo de tablas temporales y cursores a transformaciones de DataFrame
- Validación y comparación con la salida original
Día 2 — Delta Lake avanzado y carga incremental
- Transacciones ACID, registros de compromiso, versiones y viaje en el tiempo
- Auto Loader, patrones MERGE INTO, inserciones actualizadas (upserts) y evolución de esquemas
- OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento
Laboratorio del Día 2 — Ingesta incremental y optimización
- Implementación de la ingesta con Auto Loader y flujos de trabajo MERGE
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
- Medición de las mejoras en el rendimiento de lectura/escritura
Día 3 — SQL en Databricks, rendimiento y depuración
- Funcionalidades de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays
- Lectura de la interfaz de usuario de Spark, DAGs, barajados (shuffles), etapas, tareas y diagnóstico de cuellos de botella
- Patrones de ajuste de consultas: uniones por difusión (broadcast), indicaciones (hints), caché y reducción de vertidos (spill)
Laboratorio del Día 3 — Refactorización de SQL y ajuste de rendimiento
- Refactorizar un proceso SQL pesado en Spark SQL optimizado
- Utilizar trazas de la interfaz de usuario de Spark para identificar y corregir problemas de sesgo (skew) y barajados
- Realizar pruebas de rendimiento (benchmark) antes y después, y documentar los pasos de ajuste
Día 4 — PySpark táctico: Reemplazando la lógica procedural
- Modelo de ejecución de Spark: controlador, ejecutores, evaluación perezosa y estrategias de particionamiento
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrame
- Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables
Laboratorio del Día 4 — Refactorización de scripts procedurales
- Refactorizar un script ETL procedural en notebooks de PySpark modulares
- Introducir parametrización, pruebas de estilo unitario y funciones reutilizables
- Revisión de código y aplicación de la lista de verificación de mejores prácticas
Día 5 — Orquestación, pipeline de principio a fin y mejores prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenadores y manejo de errores
- Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquemas
- Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para la lógica de PySpark
Laboratorio del Día 5 — Construir un pipeline completo de principio a fin
- Ensamblar el pipeline Bronze → Silver → Gold orquestado con Workflows
- Implementar registro de eventos (logging), auditoría, reintentos y validaciones automatizadas
- Ejecutar el pipeline completo, validar las salidas y preparar las notas de despliegue
Operacionalización, gobernanza y preparación para producción
- Gobernanza con Unity Catalog, linaje y mejores prácticas de controles de acceso
- Costos, dimensionamiento de clústeres, escalado automático y patrones de concurrencia de trabajos
- Listas de verificación de despliegue, estrategias de reversión y creación de guiones de operación (runbooks)
Revisión final, transferencia de conocimientos y próximos pasos
- Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de formación
- Referencias, rutas de aprendizaje adicional y opciones de soporte
Requerimientos
- Comprensión de los conceptos de ingeniería de datos
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
- Familiaridad con conceptos de orquestación ETL (ADF o similar)
Público objetivo
- Gestores de tecnología con experiencia en ingeniería de datos
- Ingenieros de datos que transicionan la lógica procedural OLAP a patrones de Lakehouse
- Ingenieros de plataforma responsables de la adopción de Databricks
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 7250 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.