Temario del curso
PySpark y Aprendizaje Automático /
Módulo 1: Fundamentos de Big Data y Spark
- Descripción general del ecosistema Big Data y el papel clave que desempeña Spark en plataformas empresariales actuales
- Conceptos básicos de la arquitectura de Spark: controlador, ejecutores, gestor de clusters, evaluación diferida, DAG y planificación de ejecución
- Comparativa entre las APIs RDD y DataFrame; cuándo conviene utilizar cada una
- Creación y configuración básica de SparkSession, así como comprensión de los aspectos esenciales de la configuración de aplicaciones
Módulo 2: DataFrames en PySpark
- Lectura y escritura de información desde distintas fuentes empresariales, incluyendo formatos como CSV, JSON, Parquet o Delta
- Manipulación de DataFrames en PySpark: transformaciones, acciones, expresiones columnares, filtrado, uniones y agregados
- Ejecución de operaciones avanzadas, como funciones de ventana, manejo adecuado de fechas y estructuras anidadas
- Aplicación de mecanismos de verificación de calidad de datos; redacción de código mantenible y fácilmente reutilizable en PySpark
Módulo 3: Procesamiento eficiente de grandes volúmenes de datos
- Conceptos esenciales del rendimiento computacional: estrategias de partición, comportamiento derivado del mecanismo de reorganización de datos (shuffle), almacenamiento caché y persistencia
- Técnicas recomendadas para optimizar el desempeño: uniones con difusión de información o análisis pormenorizado de planes de ejecución
- Tratamiento óptimo de grandes volúmenes de datos; mejores prácticas para crear flujos de trabajo escalables y eficientes
- Introducción a la evolución continua de esquemas de información, así como los formatos de almacenamiento empleados en el sector corporativo
Módulo 4: Ingeniería de características a gran escala
- Ejecución de tareas de ingeniería de características con Spark MLlib; manejo adecuado de valores faltantes, codificación correcta de variables categóricas y escalado apropiado
- Creación de etapas reutilizables para preprocesamiento, con el fin de preparar conjuntos de datos listos para pipelines dedicados al Aprendizaje Automático
- Introducción a la selección de variables características y a procedimientos para gestionar situaciones en las que existen desequilibrios entre categorías de información
Módulo 5: Aprendizaje Automático mediante Spark MLlib
- Descripción estructurada de la arquitectura general de MLlib, junto con el patrón básico compuesto por estimadores y transformadores
- Entrenamiento efectivo de modelos predictivos y clasificadores a gran escala: Regresión Lineal, Regresión Logística, Árboles de Decisión o Bosques Aleatorios
- Comparación detallada entre distintos modelos; interpretación correcta de resultados en entornos distribuidos destinados al Aprendizaje Automático
Módulo 6: Pipelines completos del Aprendizaje Automático
- Elaboración de pipelines íntegros que incluyan tanto etapas previas como el diseño propiamente dicho de los modelos algorítmicos
- Aplicación rigurosa de estrategias para dividir correctamente la información disponible en subgrupos de entrenamiento, validación y prueba
- Ejecución avanzada de validaciones cruzadas o procedimientos automatizados para ajustar parámetros mediante búsqueda en cuadrícula o aleatoria
- Organización metódica y estructurada de experimentos reproductibles asociados al Aprendizaje Automático
Módulo 7: Evaluación de modelos y decisiones prácticas derivadas del Aprendizaje Automático
- Utilización adecuada de métricas estadísticas para evaluar resultados en tareas de regresión y clasificación
- Detección temprana de situaciones como sobreajuste o subaprendizaje; decisiones operativas respecto a la selección óptima de algoritmos predictivos
- Interpretación válida del grado de influencia de cada variable y comprensión global del comportamiento funcional de los modelos desarrollados
Módulo 8: Prácticas productivas para despliegues corporativos
- Procedimientos de almacenamiento permanente y recuperación segura de modelos entrenados dentro del entorno Spark
- Implementación eficaz de flujos de trabajo para inferencia por lotes en escenarios que involucran grandes volúmenes de datos
- Explicación detallada del ciclo vital completo de modelos predictivos dentro de estructuras corporativas complejas
- Introducción a mecanismos como control y registro de versiones, trazabilidad sistemática de ensayos realizados o técnicas básicas para pruebas algorítmicas
Resultados finales alcanzables
- Capacidad demostrada para desenvolverse de manera independiente utilizando PySpark como herramienta principal
- Habilidad confirmada para manipular y procesar grandes conjuntos informáticos en tiempo récord
- Competencia probada al ejecutar acciones de ingeniería de características con gran escala
- Capacidad comprobada para concebir pipelines sólidos dedicados al Aprendizaje Automático, siempre que haya volúmenes significativos a gestionar
Requerimientos
Para participar, se recomienda contar con el siguiente nivel previo de conocimientos:
Conocimientos básicos de programación en Python, incluyendo uso de funciones, estructuras de datos y librerías
Entendimiento general sobre conceptos fundamentales del análisis de datos: conjuntos de información, transformaciones y agregados
Conocimientos básicos de SQL y principios asociados al manejo de bases de datos relacionales
Una comprensión introductoria sobre conceptos del Aprendizaje Automático: conjuntos de entrenamiento, variables características e indicadores de evaluación
Se valora también la familiaridad con el uso de terminales y prácticas estándar en desarrollo de software
Aunque no es obligatorio, resulta útil contar con experiencia previa en librerías para procesamiento de datos como Pandas o NumPy.
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 4350 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (1)
Me gustó que fuera práctico. Amé aplicar el conocimiento teórico con ejemplos prácticos.
Aurelia-Adriana - Allianz Services Romania
Curso - Python and Spark for Big Data (PySpark)
Traducción Automática