Temario del curso
Plataforma Databricks y fundamentos del Lakehouse
- Arquitectura y componentes del Lakehouse de Databricks.
- Organización de espacios de trabajo y catálogos.
Espacio de trabajo de Databricks y cuadernos (notebooks)
- Navegación del espacio de trabajo y desarrollo basado en cuadernos.
- Estructuración del código en cuadernos reutilizables.
Arquitectura y ejecución de Apache Spark
- Arquitectura del entorno de ejecución de Spark y modelo de ejecución.
- Evaluación diferida y DAG del trabajo (job DAG).
DataFrames de PySpark y la API de DataFrames
- Abstracciones de DataFrames y esquemas.
- Operaciones principales de DataFrames y expresiones de columnas.
Traducción de SQL a DataFrames en PySpark
- Traducción de cláusulas SQL básicas a operaciones de DataFrames.
- Funciones de ventana y agregaciones en PySpark.
Lectura y escritura de datos en Databricks
- Lectura desde fuentes comunes de archivos y bases de datos.
- Escriptura y particionamiento de datos en el Lakehouse.
Delta Lake y gestión de tablas
- Tablas Delta y transacciones ACID.
- Viaje en el tiempo (time travel) y evolución del esquema.
Patrones de limpieza y transformación de datos
- Limpieza de datos y conversión de tipos.
- Construcción de lógica de transformación reutilizable.
Funciones definidas por el usuario (UDF) y código modular
- UDFs en Python y UDFs con pandas.
- Modularización de la lógica procedimental en funciones.
Ajuste de rendimiento y optimización
- Estrategias de particionamiento y almacenamiento en caché (caching).
- Detección de cuellos de botella mediante la interfaz de usuario de Spark.
Fundamentos de Structured Streaming
- Modelos de procesamiento por lotes frente a streaming.
- DataFrames en streaming y agregaciones básicas.
Trabajos (Jobs) y orquestación de flujos de trabajo en Databricks
- Programación de cuadernos como trabajos y tareas.
- Construcción de flujos de trabajo de múltiples pasos con dependencias.
Unity Catalog y gobernanza de datos
- Arquitectura de Unity Catalog y espacios de nombres.
- Control de acceso y linaje de datos.
Pruebas, depuración y prácticas de producción
- Pruebas unitarias de la lógica en PySpark.
- Depuración y estándares de calidad del código.
Casos de uso finales en servicios financieros
- Construcción de un pipeline ETL bancario completo.
- Traducción de procesos SQL heredados a PySpark.
Migración de cargas de trabajo SQL a PySpark
- Estrategia de migración y patrones de planificación.
- Conversión incremental de flujos de trabajo SQL a PySpark.
Requerimientos
- Experiencia con programación en Python, incluyendo funciones y tipos de datos.
- Conocimiento de SQL, incluyendo uniones (joins), agregaciones y subconsultas.
- No se requiere experiencia previa con Databricks o PySpark.
Público objetivo
- Ingenieros de datos, analistas de datos y profesionales relacionados.
- Equipos que migran flujos de trabajo basados en SQL existentes hacia Databricks y PySpark.
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 7250 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (2)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.
Sandra Mariela Lopez Bernal - Kueski
Curso - Databricks
Me gustó que fuera práctico. Amé aplicar el conocimiento teórico con ejemplos prácticos.
Aurelia-Adriana - Allianz Services Romania
Curso - Python and Spark for Big Data (PySpark)
Traducción Automática