Solicitar información

Temario del curso

Introducción:

  • Apache Spark en el ecosistema Hadoop
  • Breve introducción a Python y Scala

Fundamentos (teoría):

  • Arquitectura
  • RDD
  • Transformaciones y acciones
  • Etapas, tareas y dependencias

Comprensión de los fundamentos en el entorno de Databricks (taller práctico):

  • Ejercicios utilizando la API de RDD
  • Funciones básicas de acciones y transformaciones
  • PairRDD
  • Uniones (Join)
  • Estrategias de almacenamiento en caché
  • Ejercicios utilizando la API de DataFrame
  • SparkSQL
  • DataFrame: selección, filtrado, agrupación y ordenación
  • UDF (Funciones Definidas por el Usuario)
  • Exploración de la API de DataSet
  • Procesamiento de flujo (Streaming)

Comprensión de la implementación en el entorno de AWS (taller práctico):

  • Fundamentos de AWS Glue
  • Comprensión de las diferencias entre AWS EMR y AWS Glue
  • Ejemplos de trabajos en ambos entornos
  • Análisis de ventajas y desventajas

Temas adicionales:

  • Introducción a la orquestación con Apache Airflow

Requerimientos

Conocimientos de programación (preferiblemente en Python o Scala)

Conceptos básicos de SQL

 21 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 4350 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Reseñas (3)

Próximos cursos

Categorías Relacionadas