Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión dura 2 horas
Día 1: Sesión 1 – Introducción y justificación del Big Data en el gobierno
- Casos prácticos de los Institutos Nacionales de Salud y el Departamento de Energía
- Índice de adopción del Big Data entre agencias gubernamentales y su estrategia futura basada en análisis predictivo con Big Data
- Aplicaciones generales en el Departamento de Defensa, la Agencia de Seguridad Nacional, el IRS y el USDA, entre otros
- Integración del Big Data con sistemas legacy existentes
- Explicación básica de tecnologías habilitadoras para el análisis predictivo
- Integración de datos y visualización mediante paneles interactivos
- Gestión del fraude
- Generación de reglas empresariales o mecanismos de detección de fraudes
- Detección y perfilado de amenazas cibernéticas
- Análisis costo-beneficio para la implementación del Big Data
Día 1: Sesión 2 – Introducción al Big Data-1
- Características fundamentales del Big Data: volumen, variedad, velocidad y veracidad; arquitectura MPP para gestionar grandes volúmenes.
- Bases de datos relacionales – esquemas estáticos y conjuntos de datos que evolucionan lentamente
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza o Vertica, etc.
- Soluciones basadas en Hadoop – compatibles con cualquier tipo de estructura de datos.
- Patrón habitual: HDFS, MapReduce (procesamiento intensivo) y posterior acceso a los datos desde HDFS
- Procesamiento por lotes, ideal para análisis no interactivo
- Manejo de volúmenes masivos – flujos de datos en tiempo real mediante CEP
- Opciones comunes: productos CEP como Infostreams, Apama y MarkLogic, etc.
- Alternativas menos maduras para producción: Storm y S4
- Bases de datos NoSQL – tanto orientadas a columnas como clave-valor; útiles como complemento analítico frente a las bases de datos tradicionales.
Día 1: Sesión 3 – Introducción al Big Data-2
Soluciones NoSQL
- Almacenes clave-valor: Keyspace, Flare, SchemaFree, RAMCloud y Oracle NoSQL Database (OnDB)
- Otros ejemplos de almacenes clave-valor: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb y DovetailDB
- Almacenes jerárquicos tipo clave-valor: GT.m y Cache
- Almacenes ordenados por claves: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB y Actord
- Cachés de clave-valor: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity y Terracoqua
- Almacenes de tuplas: Gigaspaces, Coord y Apache River
- Bases de datos orientadas a objetos: ZopeDB, DB40 y Shoal
- Almacenes documentales: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, bases de datos XML, ThruDB, CloudKit, Prsevere, Riak-Basho y Scalaris
- Almacenes de columnas anchas: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase y KDI
Tipos de datos y limpieza de información en entornos Big Data
- Las bases de datos relacionales mantienen estructuras fijas; no favorecen la exploración ágil de los datos.
- Las bases NoSQL usan esquemas semiestructurados, permitiendo almacenar información sin requerir un formato previo definido.
- Problemáticas derivadas de la limpieza y normalización de datos
Día 1: Sesión 4 – Introducción al Big Data-3: Hadoop
- ¿Cuándo se debe optar por Hadoop?
- Las bases de datos empresariales pueden manejar grandes volúmenes, aunque a un alto coste y con limitaciones en cuanto a flexibilidad (no aptos para exploración dinámica).
- Los datos semiestructurados resultan difíciles de gestionar mediante herramientas tradicionales.
- El proceso de almacenamiento masivo implica un gran esfuerzo y genera sistemas estáticos una vez implementados.
- Para manejar múltiples tipos y volúmenes de información, Hadoop brinda soluciones mediante hardware convencional.
- Es necesario utilizar equipos estándar para conformar un clúster Hadoop
Introducción a MapReduce e HDFS
- MapReduce permite distribuir el procesamiento en múltiples servidores simultáneamente.
- HDFS facilita la disponibilidad local de los datos para su uso computacional (incluye redundancia).
- El sistema admite datos sin estructura previa, a diferencia de las bases relacionales.
- Los desarrolladores tienen el compromiso de interpretar dichos datos y derivar conocimientos útiles.
- Programación MapReduce requiere Java; además, implica la carga manual de datos hacia HDFS.
Día 2: Sesión 1 – Ecosistema Big Data: ETL y selección de herramientas
- Comparación entre Hadoop y otras soluciones NoSQL
- Uso para acceso aleatorio e interactivo a los datos
- HBase – base de datos orientada a columnas que funciona sobre plataforma Hadoop
- Posibilidad de acceso dinámico, aunque su capacidad máxima es de 1 PB.
- No se adapta al análisis ad hoc; sin embargo, es útil para tareas como registro, conteo o manejo de series temporales.
- Sqoop: transfiere datos desde bases relacionales a Hive o HDFS mediante acceso JDBC/ODBC.
- Flume captura flujos de datos (por ejemplo, registros) y los envía hacia HDFS.
Día 2: Sesión 2 – Sistemas de gestión del Big Data
- ZooKeeper gestiona la configuración, coordinación e identificación de nodos en entornos dinámicos donde los servidores se inician o fallan.
- Oozie facilita el control y planificado de flujos complejos, vinculando tareas y dependencias entre sí.
- Ambari simplifica la administración: despliegue, configuración, gestión del clúster y actualizaciones (útil para administradores de sistemas).
- Whirr es otra alternativa destinada al entorno Cloud.
Día 2: Sesión 3 – Análisis predictivo en la inteligencia empresarial-1: Técnicas fundamentales y aprendizaje automático
- Introducción a los conceptos básicos del aprendizaje automático.
- Técnicas de clasificación para identificar patrones.
- Aplicación predictiva bayesiana; preparación previa de archivos con datos de entrenamiento.
- Uso de máquinas de vectores de soporte (SVM) como método eficaz.
- Métodos álgebra p-Tree KNN y minería vertical aplicados al análisis predictivo.
- Redes neuronales para la predicción automática.
- Abordaje de problemas complejos mediante el bosque aleatorio (Random Forest).
- Aplicación de enfoques multidisciplinarios mediante el conjunto híbrido RF para automatización del procesamiento.
- Automatización operativa usando Soft10-M como herramienta avanzada.
- Uso del software Treeminer para análisis de texto y extracción de insights.
- Aprendizaje ágil e iterativo, adecuado a cambios constantes.
- Aprendizaje basado en agentes independientes.
- Distribución global del aprendizaje mediante sistemas descentralizados.
- Introducción a herramientas gratuitas de análisis predictivo: R, RapidMiner y Mahut.
Día 2: Sesión 4 – Ecosistema de análisis predictivo-2: Desafíos frecuentes en el sector gubernamental
- Análisis descriptivos para extraer insights útiles.
- Visualización eficaz de tendencias y hallazgos clave.
- Predicción basada en datos estructurados.
- Identificación de patrones en información no estructurada.
- Perfilado de amenazas, fraude y posibles conductas indebidas por parte de proveedores.
- Sistemas recomendadores que sugieren acciones según criterios internos.
- Detección automática de patrones ocultos dentro del conjunto informativo.
- Identificación automatizada de reglas o escenarios críticos: fallos operativos, fraudes y optimizaciones posibles.
- Determinación de causas raíz detrás de resultados inesperados.
- Análisis de sentimiento en texto para evaluar opiniones públicas.
- Aplicación del análisis CRM para la gestión de relaciones con ciudadanos y organizaciones externas.
- Análisis de redes sociales y conexiones entre actores clave.
- Técnicas avanzadas de minería textual en diversos formatos.
- Aplicación de revisiones asistidas por tecnología para auditorías regulatorias.
- Detección proactiva y contramedidas ante actividades fraudulentas.
- Procesamiento analítico a tiempo real, crítico para tomar decisiones inmediatas.
Día 3: Sesión 1 – Procesamiento analítico en tiempo real mediante Hadoop
- Razones por las que muchos algoritmos tradicionales no son aplicables a entornos Hadoop/HDFS.
- Apache Hama para computación distribuida y síncrona masiva.
- Apache Spark, solución ideal para el procesamiento analítico instantáneo en clústeres.
- Métodos asincrónicos basados en grafos, como los descritos por el Laboratorio de Gráficos de la Universidad Carnegie Mellon.
- Enfoque álgebra p-KNN implementado por Treeminer para reducir requerimientos computacionales y costos operativos.
Día 3: Sesión 2 – Herramientas especializadas en eDiscovery y análisis forense
- Comparación entre recuperación de información mediante Big Data o sistemas tradicionales, desde el punto de vista del coste y desempeño.
- Codificación predictiva como método avanzado junto con la revisión asistida por máquina (TAR).
- Demostración práctica con un producto TAR, vMiner, para ilustrar cómo estos sistemas agilizan procesos de recuperación documental.
- Aceleración en la indexación mediante HDFS; se incrementa así la velocidad general de búsqueda e identificación.
- Técnicas del Procesamiento Lenguaje Natural (NLP) y herramientas gratuitas aplicables a este campo.
- Procesamiento automático de documentos en múltiples idiomas para agilizar análisis transnacionales.
Día 3: Sesión 3 – Aplicaciones Big Data en la Inteligencia de Seguridad Cibernética
- Conceptos básicos sobre ciberseguridad: superficie atacable, configuraciones vulnerables y mecanismos defensivos.
- Infraestructura de red con capacidad para manejar flujos masivos; procesamiento ETL en tiempo real para análisis proactivo.
- Diferencias clave entre reglas predefinidas y sistemas que detectan automáticamente patrones amenazantes a partir de metadatos contextuales.
Día 3: Sesión 4 – Big Data en el USDA: Uso agrícola de grandes volúmenes de datos
- Introducción al Internet de las Cosas (IoT) como motor para la recolección masiva de información sensorial y control ambiental.
- Imágenes satelitales aplicadas a fines agrícolas, ayudando a planear labores con precisión.
- Integración sinérgica entre datos sensores y fotografías espaciales para evaluar fertilidad del suelo, recomendar cultivos adecuados e incluso predecir cosechas.
- Aplicaciones del Big Data en seguros agrícolas.
- Predicción automática de pérdidas potenciales en producciones vegetales.
Día 4: Sesión 1 – Detección proactiva de fraudes mediante Big Data
- Clasificación general de los modelos analíticos anti-fraude: estructuras basadas en reglas vs. estrategias predictivas.
- Selección entre aprendizaje supervisado y no supervisado al identificar anomalías fraudulentas.
- Detectar posibles irregularidades como facturaciones excesivas o contratos anómalos por parte de proveedores.
- Técnicas avanzadas aplicables a la revisión automática y detección de fraudes en procesamiento de reclamaciones de Medicare y Medicaid.
- Identificación temprana de casos sospechosos de abuso en indemnizaciones por viajes oficiales.
- Métodos para rastrear anomalías detectadas en solicitudes de reintegros impositivos gestionados por el IRS.
- Se exhibirán casos reales y demostraciones prácticas, siempre que existan datos pertinentes disponibles.
Día 4: Sesión 2 – Análisis de redes sociales como herramienta de inteligencia
- APIs Big Data para la extracción automática de contenidos generados en redes sociales.
- Manejo integrado de texto, imágenes y metadatos así como videos compartidos digitalmente.
- Análisis semántico del sentimiento subyacente tras los mensajes publicados por ciudadanos o grupos críticos.
- Filtrado contextual para aislar información relevante, minimizando interferencias no vinculadas al tema.
- Desarrollo de cuadros de mando interactivos que agrupen fuentes diversas de comunicación social.
- Creación automática de perfiles basados en datos públicos extraídos y analizados.
- Demostración práctica de cada técnica empleando la herramienta Treeminer.
Día 4: Sesión 3 – Procesamiento avanzado de imágenes y flujos visuales con Big Data
- Estrategias actualizadas para almacenar archivos gráficos en volúmenes superiores a los petabytes.
- Tecnologías como LTFS y LTO útiles para optimizar la retención masiva.
- Soluciones de capas múltiples, como GPFS-LTFS, diseñadas especialmente para gestionar acervos visuales de gran extensión.
- Conceptos básicos sobre análisis computacional de imágenes.
- Técnicas de reconocimiento automático de objetos.
- Métodos modernos de segmentación fotográfica y aislamiento de elementos significativos.
- Seguimiento preciso del movimiento y desplazamiento espacial de figuras en vídeos.
- Técnicas precisas para reconstrucción tridimensional mediante múltiples tomas fotográficas.
Día 4: Sesión 4 – Big Data y bioinformática aplicada a los NIH
- Campos emergentes en la disciplina de la bioinformática relacionados directamente con big data.
- Problemáticas analíticas derivadas del análisis conjunto de datos genómicos y su integración masiva.
- Aplicaciones predictivas basadas en Big Data para estudios de farmacogenómica, metabolómica y proteómica.
- Uso intensivo de grandes volúmenes informativos durante procesos posteriores a secuenciación genética.
- Incorporación estratégica del Big Data como aliado de la salud pública en el diseño de políticas y respuestas institucionales.
Paneles interactivos para consultar datos de forma rápida y visualmente intuitiva:
- Conexión fluida entre plataformas preexistentes y paneles analíticos generados con Big Data.
- Soluciones eficaces para la gestión operativa centralizada de información masiva.
- Ejemplo de éxito: Tablaa y Pentaho como modelos validados para el diseño de interfaces analíticas.
- Potencial transformador al aplicar servicios geolocalizados basados en Big Data para mejorar eficiencia interna del gobierno.
- Sistemas automáticos de seguimiento y supervisión gerencial avanzada.
Día 5: Sesión 1 – Justificación económica e impacto organizacional de la implementación del Big Data
- Determinación cuantitativa del retorno de inversión generado tras adoptar el Big Data.
- Estudios que demuestran cómo se reduce tiempo dedicado al acopio y preparación manuales de datos, con mejoras sustanciales en productividad general.
- Exemplos históricos donde se ahorraron costos significativos mediante la reducción de licencias pagadas para bases relacionales tradicionales.
- Beneficios económicos derivados del despliegue operativo de servicios basados en ubicación geográfica.
- Economías logradas mediante la detección temprana y reducción efectiva de actividades fraudulentas.
- Método práctico combinando hojas de cálculo para calcular aproximadamente costos asociados frente a los incrementos en ganancias o ahorros resultantes.
Día 5: Sesión 2 – Guía paso a paso para migrar sistemas heredarios al Big Data
- Descripción de rutas viables y estrategias reales durante procesos de transición.
- Tipo de información relevante que debe identificarse antes de diseñar la arquitectura deseada.
- Métodos probados para medir características principales: volumen, velocidad, variedad y veracidad del flujo masivo.
- Cálculo previsible sobre crecimiento progresivo del conjunto de datos operativos.
- Revisión crítica y comparativa de varios ejemplos concretos o casos ilustrativos.
Día 5: Sesión 4 – Evaluación técnica de proveedores líderes y análisis detallado de sus plataformas. Ronda de preguntas y respuestas:
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (conocida antes como 10Gen)
- MU Sigma
- NetApp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce<\/li>
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte integrante de EMC)
Requerimientos
- Conocimientos básicos sobre el funcionamiento empresarial y los sistemas de datos en el sector gubernamental /li>
- Comprensión inicial de SQL/Oracle o bases de datos relacionales /li>
- Familiaridad básica con estadística (a nivel de hojas de cálculo) /li>
35 Horas
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 7250 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática