Solicitar información

Temario del curso

Cada sesión dura 2 horas

Día 1: Sesión 1 – Introducción y justificación del Big Data en el gobierno

  • Casos prácticos de los Institutos Nacionales de Salud y el Departamento de Energía
  • Índice de adopción del Big Data entre agencias gubernamentales y su estrategia futura basada en análisis predictivo con Big Data
  • Aplicaciones generales en el Departamento de Defensa, la Agencia de Seguridad Nacional, el IRS y el USDA, entre otros
  • Integración del Big Data con sistemas legacy existentes
  • Explicación básica de tecnologías habilitadoras para el análisis predictivo
  • Integración de datos y visualización mediante paneles interactivos
  • Gestión del fraude
  • Generación de reglas empresariales o mecanismos de detección de fraudes
  • Detección y perfilado de amenazas cibernéticas
  • Análisis costo-beneficio para la implementación del Big Data

Día 1: Sesión 2 – Introducción al Big Data-1

  • Características fundamentales del Big Data: volumen, variedad, velocidad y veracidad; arquitectura MPP para gestionar grandes volúmenes.
  • Bases de datos relacionales – esquemas estáticos y conjuntos de datos que evolucionan lentamente
  • Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza o Vertica, etc.
  • Soluciones basadas en Hadoop – compatibles con cualquier tipo de estructura de datos.
  • Patrón habitual: HDFS, MapReduce (procesamiento intensivo) y posterior acceso a los datos desde HDFS
  • Procesamiento por lotes, ideal para análisis no interactivo
  • Manejo de volúmenes masivos – flujos de datos en tiempo real mediante CEP
  • Opciones comunes: productos CEP como Infostreams, Apama y MarkLogic, etc.
  • Alternativas menos maduras para producción: Storm y S4
  • Bases de datos NoSQL – tanto orientadas a columnas como clave-valor; útiles como complemento analítico frente a las bases de datos tradicionales.

Día 1: Sesión 3 – Introducción al Big Data-2

Soluciones NoSQL

  • Almacenes clave-valor: Keyspace, Flare, SchemaFree, RAMCloud y Oracle NoSQL Database (OnDB)
  • Otros ejemplos de almacenes clave-valor: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb y DovetailDB
  • Almacenes jerárquicos tipo clave-valor: GT.m y Cache
  • Almacenes ordenados por claves: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB y Actord
  • Cachés de clave-valor: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity y Terracoqua
  • Almacenes de tuplas: Gigaspaces, Coord y Apache River
  • Bases de datos orientadas a objetos: ZopeDB, DB40 y Shoal
  • Almacenes documentales: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, bases de datos XML, ThruDB, CloudKit, Prsevere, Riak-Basho y Scalaris
  • Almacenes de columnas anchas: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase y KDI

Tipos de datos y limpieza de información en entornos Big Data

  • Las bases de datos relacionales mantienen estructuras fijas; no favorecen la exploración ágil de los datos.
  • Las bases NoSQL usan esquemas semiestructurados, permitiendo almacenar información sin requerir un formato previo definido.
  • Problemáticas derivadas de la limpieza y normalización de datos

Día 1: Sesión 4 – Introducción al Big Data-3: Hadoop

  • ¿Cuándo se debe optar por Hadoop?
  • Las bases de datos empresariales pueden manejar grandes volúmenes, aunque a un alto coste y con limitaciones en cuanto a flexibilidad (no aptos para exploración dinámica).
  • Los datos semiestructurados resultan difíciles de gestionar mediante herramientas tradicionales.
  • El proceso de almacenamiento masivo implica un gran esfuerzo y genera sistemas estáticos una vez implementados.
  • Para manejar múltiples tipos y volúmenes de información, Hadoop brinda soluciones mediante hardware convencional.
  • Es necesario utilizar equipos estándar para conformar un clúster Hadoop

Introducción a MapReduce e HDFS

  • MapReduce permite distribuir el procesamiento en múltiples servidores simultáneamente.
  • HDFS facilita la disponibilidad local de los datos para su uso computacional (incluye redundancia).
  • El sistema admite datos sin estructura previa, a diferencia de las bases relacionales.
  • Los desarrolladores tienen el compromiso de interpretar dichos datos y derivar conocimientos útiles.
  • Programación MapReduce requiere Java; además, implica la carga manual de datos hacia HDFS.

Día 2: Sesión 1 – Ecosistema Big Data: ETL y selección de herramientas

  • Comparación entre Hadoop y otras soluciones NoSQL
  • Uso para acceso aleatorio e interactivo a los datos
  • HBase – base de datos orientada a columnas que funciona sobre plataforma Hadoop
  • Posibilidad de acceso dinámico, aunque su capacidad máxima es de 1 PB.
  • No se adapta al análisis ad hoc; sin embargo, es útil para tareas como registro, conteo o manejo de series temporales.
  • Sqoop: transfiere datos desde bases relacionales a Hive o HDFS mediante acceso JDBC/ODBC.
  • Flume captura flujos de datos (por ejemplo, registros) y los envía hacia HDFS.

Día 2: Sesión 2 – Sistemas de gestión del Big Data

  • ZooKeeper gestiona la configuración, coordinación e identificación de nodos en entornos dinámicos donde los servidores se inician o fallan.
  • Oozie facilita el control y planificado de flujos complejos, vinculando tareas y dependencias entre sí.
  • Ambari simplifica la administración: despliegue, configuración, gestión del clúster y actualizaciones (útil para administradores de sistemas).
  • Whirr es otra alternativa destinada al entorno Cloud.

Día 2: Sesión 3 – Análisis predictivo en la inteligencia empresarial-1: Técnicas fundamentales y aprendizaje automático

  • Introducción a los conceptos básicos del aprendizaje automático.
  • Técnicas de clasificación para identificar patrones.
  • Aplicación predictiva bayesiana; preparación previa de archivos con datos de entrenamiento.
  • Uso de máquinas de vectores de soporte (SVM) como método eficaz.
  • Métodos álgebra p-Tree KNN y minería vertical aplicados al análisis predictivo.
  • Redes neuronales para la predicción automática.
  • Abordaje de problemas complejos mediante el bosque aleatorio (Random Forest).
  • Aplicación de enfoques multidisciplinarios mediante el conjunto híbrido RF para automatización del procesamiento.
  • Automatización operativa usando Soft10-M como herramienta avanzada.
  • Uso del software Treeminer para análisis de texto y extracción de insights.
  • Aprendizaje ágil e iterativo, adecuado a cambios constantes.
  • Aprendizaje basado en agentes independientes.
  • Distribución global del aprendizaje mediante sistemas descentralizados.
  • Introducción a herramientas gratuitas de análisis predictivo: R, RapidMiner y Mahut.

Día 2: Sesión 4 – Ecosistema de análisis predictivo-2: Desafíos frecuentes en el sector gubernamental

  • Análisis descriptivos para extraer insights útiles.
  • Visualización eficaz de tendencias y hallazgos clave.
  • Predicción basada en datos estructurados.
  • Identificación de patrones en información no estructurada.
  • Perfilado de amenazas, fraude y posibles conductas indebidas por parte de proveedores.
  • Sistemas recomendadores que sugieren acciones según criterios internos.
  • Detección automática de patrones ocultos dentro del conjunto informativo.
  • Identificación automatizada de reglas o escenarios críticos: fallos operativos, fraudes y optimizaciones posibles.
  • Determinación de causas raíz detrás de resultados inesperados.
  • Análisis de sentimiento en texto para evaluar opiniones públicas.
  • Aplicación del análisis CRM para la gestión de relaciones con ciudadanos y organizaciones externas.
  • Análisis de redes sociales y conexiones entre actores clave.
  • Técnicas avanzadas de minería textual en diversos formatos.
  • Aplicación de revisiones asistidas por tecnología para auditorías regulatorias.
  • Detección proactiva y contramedidas ante actividades fraudulentas.
  • Procesamiento analítico a tiempo real, crítico para tomar decisiones inmediatas.

Día 3: Sesión 1 – Procesamiento analítico en tiempo real mediante Hadoop

  • Razones por las que muchos algoritmos tradicionales no son aplicables a entornos Hadoop/HDFS.
  • Apache Hama para computación distribuida y síncrona masiva.
  • Apache Spark, solución ideal para el procesamiento analítico instantáneo en clústeres.
  • Métodos asincrónicos basados en grafos, como los descritos por el Laboratorio de Gráficos de la Universidad Carnegie Mellon.
  • Enfoque álgebra p-KNN implementado por Treeminer para reducir requerimientos computacionales y costos operativos.

Día 3: Sesión 2 – Herramientas especializadas en eDiscovery y análisis forense

  • Comparación entre recuperación de información mediante Big Data o sistemas tradicionales, desde el punto de vista del coste y desempeño.
  • Codificación predictiva como método avanzado junto con la revisión asistida por máquina (TAR).
  • Demostración práctica con un producto TAR, vMiner, para ilustrar cómo estos sistemas agilizan procesos de recuperación documental.
  • Aceleración en la indexación mediante HDFS; se incrementa así la velocidad general de búsqueda e identificación.
  • Técnicas del Procesamiento Lenguaje Natural (NLP) y herramientas gratuitas aplicables a este campo.
  • Procesamiento automático de documentos en múltiples idiomas para agilizar análisis transnacionales.

Día 3: Sesión 3 – Aplicaciones Big Data en la Inteligencia de Seguridad Cibernética

  • Conceptos básicos sobre ciberseguridad: superficie atacable, configuraciones vulnerables y mecanismos defensivos.
  • Infraestructura de red con capacidad para manejar flujos masivos; procesamiento ETL en tiempo real para análisis proactivo.
  • Diferencias clave entre reglas predefinidas y sistemas que detectan automáticamente patrones amenazantes a partir de metadatos contextuales.

Día 3: Sesión 4 – Big Data en el USDA: Uso agrícola de grandes volúmenes de datos

  • Introducción al Internet de las Cosas (IoT) como motor para la recolección masiva de información sensorial y control ambiental.
  • Imágenes satelitales aplicadas a fines agrícolas, ayudando a planear labores con precisión.
  • Integración sinérgica entre datos sensores y fotografías espaciales para evaluar fertilidad del suelo, recomendar cultivos adecuados e incluso predecir cosechas.
  • Aplicaciones del Big Data en seguros agrícolas.
  • Predicción automática de pérdidas potenciales en producciones vegetales.

Día 4: Sesión 1 – Detección proactiva de fraudes mediante Big Data

  • Clasificación general de los modelos analíticos anti-fraude: estructuras basadas en reglas vs. estrategias predictivas.
  • Selección entre aprendizaje supervisado y no supervisado al identificar anomalías fraudulentas.
  • Detectar posibles irregularidades como facturaciones excesivas o contratos anómalos por parte de proveedores.
  • Técnicas avanzadas aplicables a la revisión automática y detección de fraudes en procesamiento de reclamaciones de Medicare y Medicaid.
  • Identificación temprana de casos sospechosos de abuso en indemnizaciones por viajes oficiales.
  • Métodos para rastrear anomalías detectadas en solicitudes de reintegros impositivos gestionados por el IRS.
  • Se exhibirán casos reales y demostraciones prácticas, siempre que existan datos pertinentes disponibles.

Día 4: Sesión 2 – Análisis de redes sociales como herramienta de inteligencia

  • APIs Big Data para la extracción automática de contenidos generados en redes sociales.
  • Manejo integrado de texto, imágenes y metadatos así como videos compartidos digitalmente.
  • Análisis semántico del sentimiento subyacente tras los mensajes publicados por ciudadanos o grupos críticos.
  • Filtrado contextual para aislar información relevante, minimizando interferencias no vinculadas al tema.
  • Desarrollo de cuadros de mando interactivos que agrupen fuentes diversas de comunicación social.
  • Creación automática de perfiles basados en datos públicos extraídos y analizados.
  • Demostración práctica de cada técnica empleando la herramienta Treeminer.

Día 4: Sesión 3 – Procesamiento avanzado de imágenes y flujos visuales con Big Data

  • Estrategias actualizadas para almacenar archivos gráficos en volúmenes superiores a los petabytes.
  • Tecnologías como LTFS y LTO útiles para optimizar la retención masiva.
  • Soluciones de capas múltiples, como GPFS-LTFS, diseñadas especialmente para gestionar acervos visuales de gran extensión.
  • Conceptos básicos sobre análisis computacional de imágenes.
  • Técnicas de reconocimiento automático de objetos.
  • Métodos modernos de segmentación fotográfica y aislamiento de elementos significativos.
  • Seguimiento preciso del movimiento y desplazamiento espacial de figuras en vídeos.
  • Técnicas precisas para reconstrucción tridimensional mediante múltiples tomas fotográficas.

Día 4: Sesión 4 – Big Data y bioinformática aplicada a los NIH

  • Campos emergentes en la disciplina de la bioinformática relacionados directamente con big data.
  • Problemáticas analíticas derivadas del análisis conjunto de datos genómicos y su integración masiva.
  • Aplicaciones predictivas basadas en Big Data para estudios de farmacogenómica, metabolómica y proteómica.
  • Uso intensivo de grandes volúmenes informativos durante procesos posteriores a secuenciación genética.
  • Incorporación estratégica del Big Data como aliado de la salud pública en el diseño de políticas y respuestas institucionales.

Paneles interactivos para consultar datos de forma rápida y visualmente intuitiva:

  • Conexión fluida entre plataformas preexistentes y paneles analíticos generados con Big Data.
  • Soluciones eficaces para la gestión operativa centralizada de información masiva.
  • Ejemplo de éxito: Tablaa y Pentaho como modelos validados para el diseño de interfaces analíticas.
  • Potencial transformador al aplicar servicios geolocalizados basados en Big Data para mejorar eficiencia interna del gobierno.
  • Sistemas automáticos de seguimiento y supervisión gerencial avanzada.

Día 5: Sesión 1 – Justificación económica e impacto organizacional de la implementación del Big Data

  • Determinación cuantitativa del retorno de inversión generado tras adoptar el Big Data.
  • Estudios que demuestran cómo se reduce tiempo dedicado al acopio y preparación manuales de datos, con mejoras sustanciales en productividad general.
  • Exemplos históricos donde se ahorraron costos significativos mediante la reducción de licencias pagadas para bases relacionales tradicionales.
  • Beneficios económicos derivados del despliegue operativo de servicios basados en ubicación geográfica.
  • Economías logradas mediante la detección temprana y reducción efectiva de actividades fraudulentas.
  • Método práctico combinando hojas de cálculo para calcular aproximadamente costos asociados frente a los incrementos en ganancias o ahorros resultantes.

Día 5: Sesión 2 – Guía paso a paso para migrar sistemas heredarios al Big Data

  • Descripción de rutas viables y estrategias reales durante procesos de transición.
  • Tipo de información relevante que debe identificarse antes de diseñar la arquitectura deseada.
  • Métodos probados para medir características principales: volumen, velocidad, variedad y veracidad del flujo masivo.
  • Cálculo previsible sobre crecimiento progresivo del conjunto de datos operativos.
  • Revisión crítica y comparativa de varios ejemplos concretos o casos ilustrativos.

Día 5: Sesión 4 – Evaluación técnica de proveedores líderes y análisis detallado de sus plataformas. Ronda de preguntas y respuestas:

  • Accenture
  • APTEAN (anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (conocida antes como 10Gen)
  • MU Sigma
  • NetApp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce<\/li>
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (parte integrante de EMC)

Requerimientos

  • Conocimientos básicos sobre el funcionamiento empresarial y los sistemas de datos en el sector gubernamental
  • Comprensión inicial de SQL/Oracle o bases de datos relacionales
  • Familiaridad básica con estadística (a nivel de hojas de cálculo)
 35 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 7250 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Reseñas (1)

Próximos cursos

Categorías Relacionadas