Temario del curso
Día 01
Introducción a la inteligencia empresarial de big data para el análisis de inteligencia criminal
- Estudios de caso en el ámbito policial: policía predictiva.
- Tasa de adopción del big data por parte de agencias policiales y su integración con el análisis predictivo basado en datos.
- Soluciones tecnológicas emergentes como sensores de disparos, video vigilancia y redes sociales.
- Uso del big data para mitigar la sobrecarga informativa.
- Integración entre el big data y los sistemas legacy de almacenamiento de datos.
- Noiones básicas sobre las tecnologías habilitadoras para el análisis predictivo.
- Integración de datos y visualización mediante dashboards.
- Gestión del fraude.
- Reglas empresariales aplicadas a la detección de fraudes.
- Detección y perfilado de amenazas.
- Análisis costo-beneficio de implementar soluciones basadas en big data.
Introducción al concepto de Big Data
- Las cuatro características fundamentales del big data: volumen, variedad, velocidad y veracidad.
- Arquitectura MPP (Procesamiento Masivo Paralelo).
- Almacenes de datos – esquemas estáticos y conjuntos de datos que evolucionan lentamente.
- Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, entre otras.
- Soluciones basadas en Hadoop – sin restricciones estructurales para los conjuntos de datos.
- Patrón habitual: HDFS, MapReduce (procesamiento intensivo) y posterior recuperación desde HDFS.
- Apache Spark como plataforma para el procesamiento en tiempo real.
- El procesamiento por lotes resulta óptimo para análisis no interactivos.
- Volumen: flujo continuo de datos mediante CEP (Procesamiento de Eventos Complejos).
- Opciones habituales en esta categoría: productos como Infostreams, Apama y MarkLogic.
- Opciones menos consolidadas para producción: Storm o S4.
- Bases de datos NoSQL – columnares y basadas en pares clave-valor: ideales como complemento analítico a almacenes de datos tradicionales.
Tipos de soluciones NoSQL
- Almacenamiento tipo clave-valor: Keyspace, Flare, SchemaFree, RAMCloud y Oracle NoSQL Database (OnDB).
- Otras variantes de almacenamiento tipo clave-valor: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb y DovetailDB.
- Almacenes jerárquicos: GT.m y Cache.
- Almacenamiento ordenado por claves: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB y Actord.
- Cachés tipo clave-valor: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity y Terracoqua.
- Almacenamiento de tuplas: Gigaspaces, Coord y Apache River.
- Bases de datos orientadas a objetos: ZopeDB, DB40 y Shoal.
- Almacenamientos tipo documento: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, bases XML, ThruDB, CloudKit, Prsevere, Riak-Basho y Scalaris.
- Almacenamiento de columnas anchas: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase y KDI.
Diversidad de datos: introducción a los retos asociados con la limpieza de datos en entornos big data
- Los sistemas RDBMS presentan estructuras predefinidas que no favorecen un entorno exploratorio y flexible.
- Las bases NoSQL son semiestructuradas, ofreciendo flexibilidad para almacenar información sin requerir un esquema definido de antemano.
- Desafíos frecuentes en la depuración y preparación de datos.
Hadoop
- ¿Cuándo conviene utilizar Hadoop?
- Las bases de datos empresariales permiten almacenar grandes volúmenes de información (a un coste elevado) pero imponen fuertes requisitos estructurales, limitando la exploración activa.
- Los datos semiestructurados son difíciles de gestionar con métodos tradicionales (como DW o bases relacionales).
- La creación y mantenimiento de almacenes de datos requiere un esfuerzo monumental, además del resultado final permanece estático tras su implementación.
- Frente a la diversidad y gran volumen de datos, Hadoop resulta óptimo gracias a su ejecución sobre hardware convencional.
- Para constituir un cluster Hadoop se requiere hardware básico, de coste reducido.
Introducción a MapReduce y HDFS
- MapReduce distribuye el procesamiento informático en múltiples servidores simultáneamente.
- HDFS permite que los datos estén disponibles localmente durante el cálculo, garantizando redundancia.
- Este sistema admite datos sin estructura ni esquema predefinido, al contrario de las bases RDBMS tradicionales.
- El desarrollador asume la responsabilidad de dar sentido y aprovechar dichos datos.
- Programar con MapReduce implica trabajar en Java (ventajas e inconvenientes), así como cargar manualmente los datos en el entorno HDFS.
Día 02
Ecosistema de big data: implementación de procesos ETL para big data – ¿Qué herramientas resultan apropiadas y cuándo?
- Comparativa entre Hadoop y otras soluciones NoSQL.
- Aplicaciones que requieren acceso interactivo e indiscriminado a los datos.
- HBase – base de datos orientada por columnas integrada sobre Hadoop.
- Este sistema ofrece acceso aleatorio pero con ciertas limitaciones técnicas (capacidad máxima de 1 petabyte).
- Resulta útil para operaciones de registro, conteo o análisis en serie temporal, aunque no recomendado para análisis exploratorios.
- Sqoop: utilizado para importar datos desde bases tradicionales a Hive o HDFS mediante interfaces JDBC/ODBC.
- Flume facilita la transferencia de flujos continuos de datos (por ejemplo, registros generados por servidores) hacia el entorno HDFS.
Sistemas de gestión del big data
- En escenarios donde los componentes computacionales aparecen o desaparecen: ZooKeeper brinda servicios de configuración, coordinación y gestión de nombres.
- Gestión de flujos complejos de trabajo: Oozie organiza tareas secuenciales o entrelazadas, estableciendo dependencias entre ellas.
- Tareas administrativas como despliegues, configuración básica y actualizaciones del cluster: Ambari se encarga de ello, especialmente útil para administradores de sistemas.
- En entornos cloud, Whirr ofrece servicios complementarios en este ámbito.
Análisis predictivo: técnicas fundamentales y aplicaciones basadas en aprendizaje automático para la inteligencia empresarial
- Introducción al aprendizaje automático.
- Técnicas para clasificación de datos.
- Predicción bayesiana – elaboración del fichero inicial de entrenamiento.
- Máquinas vectoriales de soporte (SVM).
- Algebra p-Tree en KNN y minería vertical de información.
- Redes neuronales artificiales.
- Solución para problemas con múltiples variables: Bosque aleatorio (Random Forest, RF).
- Estrategia automatizada para la gestión de big data: ensambles multiclase basados en bosques aleatorios.
- Automatización mediante el sistema Soft10-M.
- Herramienta analítica de textos Treeminer.
- Aprendizaje ágil y dinámico.
- Mecanismos basados en agentes autónomos.
- Aprendizaje distribuido entre varios nodos.
- Introducción a herramientas de código abierto para análisis predictivo: R, Python, Rapidminer y Mahut.
Ecosistema del análisis predictivo y su aplicación al análisis de inteligencia criminal
- Relación entre la tecnología disponible y los procedimientos policiales.
- Análisis que genera percepciones significativas.
- Tecnologías de visualización avanzada.
- Estrategias estructuradas para el análisis predictivo.
- Metodologías no estructuradas para este propósito.
- Perfilado de posibles amenazas, fraudes o proveedores sospechosos.
- Mecanismos de recomendación inteligente.
- Detección de patrones comunes entre conjuntos de datos.
- Identificación automatizada de reglas y escenarios, permitiendo detectar anomalías, fraudes u oportunidades de mejora.
- Determinación de causas profundas que generan un fenómeno determinado.
- Análisis del sentimiento expresado en documentos.
- Analítica CRM (gestión de relaciones con clientes).
- Técnicas para analizar estructuras complejas basadas en redes interactivas.
- Procesamiento lingüístico que permite interpretar transcripciones, declaraciones testimoniales o intercambios digitales de información.
- Revisión asistida por software para optimizar investigaciones.
- Métodos avanzados para combatir fraudes.
- Análisis instantáneo en tiempo real.
Día 03
Análisis escalable y en tiempo real mediante el entorno Hadoop
- Razones por las cuales algoritmos tradicionales de análisis resultan poco eficaces bajo el ecosistema Hadoop/HDFS.
- Apache Hama, plataforma orientada al cómputo distribuido sincronizado masivo.
- Apache Spark destaca por su capacidad para procesar información en tiempo real y gestionar clusters de cálculo.
- El laboratorio gráfico de la Universidad Carnegie Mellon emplea un modelo asíncrono basado en grafos para distribuir cargas computacionales.
- Treeminer incorpora métodos algebraicos (KNN p) que reducen significativamente el requerimiento energético y coste operativo derivado del hardware utilizado.
Herramientas para eDiscovery y análisis forense digital
- Comparativa económica y de eficiencia entre soluciones eDiscovery basadas en big data frente a métodos tradicionales aplicados a datos legacy.
- Técnicas como la codificación predictiva y el análisis asistido por software (Technology Assisted Review, TAR).
- Demostración en vivo de vMiner que ilustra cómo este software permite una identificación y clasificación mucho más rápida de contenidos relevantes.
- Incremento notable del flujo de indexado mediante el uso eficiente de HDFS para gestionar gran cantidad de información en poco tiempo.
- Procesamiento lingüístico natural (NLP): conjunto variado de productos y técnicas abiertas al desarrollo.
- Soluciones tecnológicas capaces de analizar información generada en diversos idiomas extranjeros.
Aplicaciones del big data para la ciberseguridad: crear una visión integral, acelerar la recolección y clasificación de datos críticos para detectar amenazas
- Introducción a los principios básicos del análisis de seguridad informática – superficie de ataque posible, desajustes en las configuraciones de seguridad o protecciones propias de cada dispositivo.
- Infraestructura de redes y tuberías masivas para el rápido intercambio de datos, así como procesamiento instantáneo mediante módulos ETL especializados.
- Distinción entre enfoques prescriptivos basados en reglas fijas frente a los sistemas que detectan automáticamente nuevos patrones de amenazas mediante el uso de metadatos.
Aglutinación y recolección variada de datos para el análisis forense criminal
- Uso de dispositivos IoT como sensores encargados de registrar información relevante.
- Fotografía satelital utilizada en vigilancia terrestre y reconocimiento geográfico.
- Aplicación de sistemas de videovigilancia e imágenes para la identificación criminal.
- Otras tecnologías recopiladoras: drones, cámaras corporales, geolocalización vía GPS o sensores térmicos.
- Integración entre datos automáticamente extraídos mediante herramientas digitales y información generada por testigos, interrogatorios o investigaciones previas.
- Predicción proactiva sobre posibles conductas delictivas futuras.
Día 04
Aplicación de soluciones BI basadas en big data para la prevención del fraude mediante el análisis avanzado de datos
- Clasificaciones básicas del análisis antifraude: metodologías reglísticas frente a aquellas que incorporan componentes predictivos.
- Comparativa entre aprendizaje automático supervisado y no supervisado, según su idoneidad en la detección de patrones irregulares típicos del fraude.
- Ejemplos específicos abordados: fraudes entre empresas, reclamaciones médicas falsas, estafas aseguradoras, evasión tributaria y blanqueo de capitales.
Analítica aplicada a redes sociales: extracción y comprensión de inteligencia útil
- Mecanismos que facilitan la organización, reclutamiento y planificación criminal mediante plataformas sociales.
- API especializadas en big data diseñadas para capturar información dispersa generada por redes sociales.
- Análisis diversificado: texto descriptivo, imágenes visuales, metadatos complementarios y contenido audiovisual.
- Detección de tendencias emocionales presentes en publicaciones digitales.
- Filtrado contextual de mensajes según su pertinencia temática o irrelevancia detectada mediante herramientas especializadas.
- Dashboards interactivos que unifican y procesan múltiples fuentes sociales simultáneamente.
- Perfilado automático de usuarios registrados en estas redes.
- Cada concepto descrito será ilustrado paso a paso mediante la aplicación Treeminer.
Tecnologías de big data para el tratamiento digital de imágenes y videosecuencias
- Formas modernas de almacenar información gráfica en entornos big data – soluciones adaptadas a conjuntos que superan la magnitud del petabyte.
- Tecnologías complementarias como LTFS (Sistema de Archivos Lineal por Cinta) y LTO (Tecnología Abierta para Cintas Lineales).
- Arquitectura GPFS-LTFS: combinación innovadora que permite almacenar información gráfica masiva con escalabilidad comprobada.
- Noiones básicas sobre análisis visual computarizado.
- Mecanismos automatizados para reconocimiento de elementos específicos dentro de imágenes.
- Técnicas precisas de segmentación visual, descomponiendo la imagen en múltiples partes relevantes.
- Seguimiento preciso de movimientos entre distintos fotogramas o secuencias.
- Reconstrucción tridimensional a partir de planos bidimensionales previos.
Biotecnologías: datos biométricos, ADN y programas avanzados de identificación
- Visión más allá del reconocimiento clásico mediante huellas dactilares o rostro.
- Técnicas actuales como el análisis del habla, la detección única basada en patrones tipográficos al escribir y el CODIS (Sistema Combinado de Índices Genéticos).
- Novedades fascinantes: uso forense del ADN que permite inferir rasgos faciales a partir únicamente de muestras genéticas analizadas.
Paneles dinámicos basados en big data para el acceso simplificado e integrado a información diversa:
- Conexión entre plataformas existentes y paneles de visualización avanzada del big data.
- Gestión integral del ciclo de vida de datos voluminosos generados por organizaciones.
- Ejemplo concreto: casos prácticos mostrando Tableau o Pentaho integrándose eficientemente en flujos oficiales gubernamentales.
- Uso estratégico de servicios de geolocalización respaldados por grandes volúmenes informativos en instituciones públicas.
- Sistemas robustos para monitorear y controlar operaciones internas derivadas del flujo informativo.
Día 05
Metodologías para fundamentar económicamente la implementación de sistemas de BI basados en big data:
- Cálculo exacto del retorno de inversión generado por este tipo de tecnologías.
- Estudios de caso ilustrativos que demuestran cómo se reduce drásticamente el tiempo destinado a la recolección y depuración preliminar por parte de analistas, mejorando su productividad global.
- Oportunidades sustanciales para disminuir los costes asociados a licencias de bases relacionales.
- Generación directa de ingresos adicionales derivada del empleo creativo de servicios basados en posicionamiento geográfico.
- Ahorro real generado gracias al mecanismo proactivo de detección y prevención de fraudes que estos sistemas implementan.
- Uso combinado de hojas de cálculo y modelos cuantitativos para estimar gastos necesarios frente a ganancias económicas esperadas gracias a proyectos basados en big data.
Rutina ordenada para reemplazar gradualmente sistemas legacy mediante infraestructuras totalmente basadas en Big Data:
- Planificación y cronograma completo asociado a la transición tecnológica.
- Información previa crítica imprescindible para proyectar con precisión requerimientos hardware-software necesarios.
- Métodos científicos reconocidos para cuantificar los indicadores clave de volumen, velocidad y variedad informativa disponible.
- Estrategias fiables para pronosticar el crecimiento futuro del flujo de datos.
- Análisis comparativo de estudios reales y casos exitosos documentados.
Reseña detallada sobre proveedores especializados en big data y descripciones precisas de sus productos ofrecidos:
- Accenture
- APTEAN (antes conocido como CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (antes 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (filial de EMC)
Sesión de preguntas y respuestas
Requerimientos
- Conocimiento sobre los procesos policiales y sistemas de gestión de datos
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Conocimientos elementales de estadística (a nivel de hojas de cálculo)
Público objetivo
- Especialistas policiales con formación técnica
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 7250 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales
Reseñas (3)
fundamentos y amó los documentos y ejercicios preparados
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Curso - Introduction to Predictive AI
Traducción Automática
Que fue muy priactico.
Alfonso Ramos - Banco de Mexico
Curso - Fundamentos de Integración de Datos Pentaho
Deepthi estaba muy atenta a mis necesidades, podía percibir cuándo añadir capas de complejidad y cuándo mantenerse atrás y adoptar un enfoque más estructurado. Deepthi realmente trabajó a mi ritmo y aseguró que pudiera utilizar las nuevas funciones/herramientas por mí mismo, primero mostrándome y luego dejándome recrear los elementos por mí mismo, lo cual ayudó mucho a consolidar la formación. ¡No podría estar más satisfecho con los resultados de esta capacitación y con el nivel de experiencia de Deepthi!
Deepthi - Invest Northern Ireland
Curso - IBM Cognos Analytics
Traducción Automática