Solicitar información

Temario del curso

PySpark y Aprendizaje Automático /

Módulo 1: Fundamentos de Big Data y Spark

  • Descripción general del ecosistema Big Data y el papel clave que desempeña Spark en plataformas empresariales actuales
  • Conceptos básicos de la arquitectura de Spark: controlador, ejecutores, gestor de clusters, evaluación diferida, DAG y planificación de ejecución
  • Comparativa entre las APIs RDD y DataFrame; cuándo conviene utilizar cada una
  • Creación y configuración básica de SparkSession, así como comprensión de los aspectos esenciales de la configuración de aplicaciones

Módulo 2: DataFrames en PySpark

  • Lectura y escritura de información desde distintas fuentes empresariales, incluyendo formatos como CSV, JSON, Parquet o Delta
  • Manipulación de DataFrames en PySpark: transformaciones, acciones, expresiones columnares, filtrado, uniones y agregados
  • Ejecución de operaciones avanzadas, como funciones de ventana, manejo adecuado de fechas y estructuras anidadas
  • Aplicación de mecanismos de verificación de calidad de datos; redacción de código mantenible y fácilmente reutilizable en PySpark

Módulo 3: Procesamiento eficiente de grandes volúmenes de datos

  • Conceptos esenciales del rendimiento computacional: estrategias de partición, comportamiento derivado del mecanismo de reorganización de datos (shuffle), almacenamiento caché y persistencia
  • Técnicas recomendadas para optimizar el desempeño: uniones con difusión de información o análisis pormenorizado de planes de ejecución
  • Tratamiento óptimo de grandes volúmenes de datos; mejores prácticas para crear flujos de trabajo escalables y eficientes
  • Introducción a la evolución continua de esquemas de información, así como los formatos de almacenamiento empleados en el sector corporativo

Módulo 4: Ingeniería de características a gran escala

  • Ejecución de tareas de ingeniería de características con Spark MLlib; manejo adecuado de valores faltantes, codificación correcta de variables categóricas y escalado apropiado
  • Creación de etapas reutilizables para preprocesamiento, con el fin de preparar conjuntos de datos listos para pipelines dedicados al Aprendizaje Automático
  • Introducción a la selección de variables características y a procedimientos para gestionar situaciones en las que existen desequilibrios entre categorías de información

Módulo 5: Aprendizaje Automático mediante Spark MLlib

  • Descripción estructurada de la arquitectura general de MLlib, junto con el patrón básico compuesto por estimadores y transformadores
  • Entrenamiento efectivo de modelos predictivos y clasificadores a gran escala: Regresión Lineal, Regresión Logística, Árboles de Decisión o Bosques Aleatorios
  • Comparación detallada entre distintos modelos; interpretación correcta de resultados en entornos distribuidos destinados al Aprendizaje Automático

Módulo 6: Pipelines completos del Aprendizaje Automático

  • Elaboración de pipelines íntegros que incluyan tanto etapas previas como el diseño propiamente dicho de los modelos algorítmicos
  • Aplicación rigurosa de estrategias para dividir correctamente la información disponible en subgrupos de entrenamiento, validación y prueba
  • Ejecución avanzada de validaciones cruzadas o procedimientos automatizados para ajustar parámetros mediante búsqueda en cuadrícula o aleatoria
  • Organización metódica y estructurada de experimentos reproductibles asociados al Aprendizaje Automático

Módulo 7: Evaluación de modelos y decisiones prácticas derivadas del Aprendizaje Automático

  • Utilización adecuada de métricas estadísticas para evaluar resultados en tareas de regresión y clasificación
  • Detección temprana de situaciones como sobreajuste o subaprendizaje; decisiones operativas respecto a la selección óptima de algoritmos predictivos
  • Interpretación válida del grado de influencia de cada variable y comprensión global del comportamiento funcional de los modelos desarrollados

Módulo 8: Prácticas productivas para despliegues corporativos

  • Procedimientos de almacenamiento permanente y recuperación segura de modelos entrenados dentro del entorno Spark
  • Implementación eficaz de flujos de trabajo para inferencia por lotes en escenarios que involucran grandes volúmenes de datos
  • Explicación detallada del ciclo vital completo de modelos predictivos dentro de estructuras corporativas complejas
  • Introducción a mecanismos como control y registro de versiones, trazabilidad sistemática de ensayos realizados o técnicas básicas para pruebas algorítmicas

 

Resultados finales alcanzables

  • Capacidad demostrada para desenvolverse de manera independiente utilizando PySpark como herramienta principal
  • Habilidad confirmada para manipular y procesar grandes conjuntos informáticos en tiempo récord
  • Competencia probada al ejecutar acciones de ingeniería de características con gran escala
  • Capacidad comprobada para concebir pipelines sólidos dedicados al Aprendizaje Automático, siempre que haya volúmenes significativos a gestionar

Requerimientos

Para participar, se recomienda contar con el siguiente nivel previo de conocimientos:

Conocimientos básicos de programación en Python, incluyendo uso de funciones, estructuras de datos y librerías
Entendimiento general sobre conceptos fundamentales del análisis de datos: conjuntos de información, transformaciones y agregados
Conocimientos básicos de SQL y principios asociados al manejo de bases de datos relacionales
Una comprensión introductoria sobre conceptos del Aprendizaje Automático: conjuntos de entrenamiento, variables características e indicadores de evaluación
Se valora también la familiaridad con el uso de terminales y prácticas estándar en desarrollo de software

Aunque no es obligatorio, resulta útil contar con experiencia previa en librerías para procesamiento de datos como Pandas o NumPy.

 21 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 4350 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Reseñas (1)

Próximos cursos

Categorías Relacionadas