Solicitar información

Temario del curso

Día 01

Introducción a la inteligencia empresarial de big data para el análisis de inteligencia criminal

  • Estudios de caso en el ámbito policial: policía predictiva.
  • Tasa de adopción del big data por parte de agencias policiales y su integración con el análisis predictivo basado en datos.
  • Soluciones tecnológicas emergentes como sensores de disparos, video vigilancia y redes sociales.
  • Uso del big data para mitigar la sobrecarga informativa.
  • Integración entre el big data y los sistemas legacy de almacenamiento de datos.
  • Noiones básicas sobre las tecnologías habilitadoras para el análisis predictivo.
  • Integración de datos y visualización mediante dashboards.
  • Gestión del fraude.
  • Reglas empresariales aplicadas a la detección de fraudes.
  • Detección y perfilado de amenazas.
  • Análisis costo-beneficio de implementar soluciones basadas en big data.

Introducción al concepto de Big Data

  • Las cuatro características fundamentales del big data: volumen, variedad, velocidad y veracidad.
  • Arquitectura MPP (Procesamiento Masivo Paralelo).
  • Almacenes de datos – esquemas estáticos y conjuntos de datos que evolucionan lentamente.
  • Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, entre otras.
  • Soluciones basadas en Hadoop – sin restricciones estructurales para los conjuntos de datos.
  • Patrón habitual: HDFS, MapReduce (procesamiento intensivo) y posterior recuperación desde HDFS.
  • Apache Spark como plataforma para el procesamiento en tiempo real.
  • El procesamiento por lotes resulta óptimo para análisis no interactivos.
  • Volumen: flujo continuo de datos mediante CEP (Procesamiento de Eventos Complejos).
  • Opciones habituales en esta categoría: productos como Infostreams, Apama y MarkLogic.
  • Opciones menos consolidadas para producción: Storm o S4.
  • Bases de datos NoSQL – columnares y basadas en pares clave-valor: ideales como complemento analítico a almacenes de datos tradicionales.

Tipos de soluciones NoSQL

  • Almacenamiento tipo clave-valor: Keyspace, Flare, SchemaFree, RAMCloud y Oracle NoSQL Database (OnDB).
  • Otras variantes de almacenamiento tipo clave-valor: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb y DovetailDB.
  • Almacenes jerárquicos: GT.m y Cache.
  • Almacenamiento ordenado por claves: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB y Actord.
  • Cachés tipo clave-valor: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity y Terracoqua.
  • Almacenamiento de tuplas: Gigaspaces, Coord y Apache River.
  • Bases de datos orientadas a objetos: ZopeDB, DB40 y Shoal.
  • Almacenamientos tipo documento: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, bases XML, ThruDB, CloudKit, Prsevere, Riak-Basho y Scalaris.
  • Almacenamiento de columnas anchas: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase y KDI.

Diversidad de datos: introducción a los retos asociados con la limpieza de datos en entornos big data

  • Los sistemas RDBMS presentan estructuras predefinidas que no favorecen un entorno exploratorio y flexible.
  • Las bases NoSQL son semiestructuradas, ofreciendo flexibilidad para almacenar información sin requerir un esquema definido de antemano.
  • Desafíos frecuentes en la depuración y preparación de datos.

Hadoop

  • ¿Cuándo conviene utilizar Hadoop?
  • Las bases de datos empresariales permiten almacenar grandes volúmenes de información (a un coste elevado) pero imponen fuertes requisitos estructurales, limitando la exploración activa.
  • Los datos semiestructurados son difíciles de gestionar con métodos tradicionales (como DW o bases relacionales).
  • La creación y mantenimiento de almacenes de datos requiere un esfuerzo monumental, además del resultado final permanece estático tras su implementación.
  • Frente a la diversidad y gran volumen de datos, Hadoop resulta óptimo gracias a su ejecución sobre hardware convencional.
  • Para constituir un cluster Hadoop se requiere hardware básico, de coste reducido.

Introducción a MapReduce y HDFS

  • MapReduce distribuye el procesamiento informático en múltiples servidores simultáneamente.
  • HDFS permite que los datos estén disponibles localmente durante el cálculo, garantizando redundancia.
  • Este sistema admite datos sin estructura ni esquema predefinido, al contrario de las bases RDBMS tradicionales.
  • El desarrollador asume la responsabilidad de dar sentido y aprovechar dichos datos.
  • Programar con MapReduce implica trabajar en Java (ventajas e inconvenientes), así como cargar manualmente los datos en el entorno HDFS.

Día 02

Ecosistema de big data: implementación de procesos ETL para big data – ¿Qué herramientas resultan apropiadas y cuándo?

  • Comparativa entre Hadoop y otras soluciones NoSQL.
  • Aplicaciones que requieren acceso interactivo e indiscriminado a los datos.
  • HBase – base de datos orientada por columnas integrada sobre Hadoop.
  • Este sistema ofrece acceso aleatorio pero con ciertas limitaciones técnicas (capacidad máxima de 1 petabyte).
  • Resulta útil para operaciones de registro, conteo o análisis en serie temporal, aunque no recomendado para análisis exploratorios.
  • Sqoop: utilizado para importar datos desde bases tradicionales a Hive o HDFS mediante interfaces JDBC/ODBC.
  • Flume facilita la transferencia de flujos continuos de datos (por ejemplo, registros generados por servidores) hacia el entorno HDFS.

Sistemas de gestión del big data

  • En escenarios donde los componentes computacionales aparecen o desaparecen: ZooKeeper brinda servicios de configuración, coordinación y gestión de nombres.
  • Gestión de flujos complejos de trabajo: Oozie organiza tareas secuenciales o entrelazadas, estableciendo dependencias entre ellas.
  • Tareas administrativas como despliegues, configuración básica y actualizaciones del cluster: Ambari se encarga de ello, especialmente útil para administradores de sistemas.
  • En entornos cloud, Whirr ofrece servicios complementarios en este ámbito.

Análisis predictivo: técnicas fundamentales y aplicaciones basadas en aprendizaje automático para la inteligencia empresarial

  • Introducción al aprendizaje automático.
  • Técnicas para clasificación de datos.
  • Predicción bayesiana – elaboración del fichero inicial de entrenamiento.
  • Máquinas vectoriales de soporte (SVM).
  • Algebra p-Tree en KNN y minería vertical de información.
  • Redes neuronales artificiales.
  • Solución para problemas con múltiples variables: Bosque aleatorio (Random Forest, RF).
  • Estrategia automatizada para la gestión de big data: ensambles multiclase basados en bosques aleatorios.
  • Automatización mediante el sistema Soft10-M.
  • Herramienta analítica de textos Treeminer.
  • Aprendizaje ágil y dinámico.
  • Mecanismos basados en agentes autónomos.
  • Aprendizaje distribuido entre varios nodos.
  • Introducción a herramientas de código abierto para análisis predictivo: R, Python, Rapidminer y Mahut.

Ecosistema del análisis predictivo y su aplicación al análisis de inteligencia criminal

  • Relación entre la tecnología disponible y los procedimientos policiales.
  • Análisis que genera percepciones significativas.
  • Tecnologías de visualización avanzada.
  • Estrategias estructuradas para el análisis predictivo.
  • Metodologías no estructuradas para este propósito.
  • Perfilado de posibles amenazas, fraudes o proveedores sospechosos.
  • Mecanismos de recomendación inteligente.
  • Detección de patrones comunes entre conjuntos de datos.
  • Identificación automatizada de reglas y escenarios, permitiendo detectar anomalías, fraudes u oportunidades de mejora.
  • Determinación de causas profundas que generan un fenómeno determinado.
  • Análisis del sentimiento expresado en documentos.
  • Analítica CRM (gestión de relaciones con clientes).
  • Técnicas para analizar estructuras complejas basadas en redes interactivas.
  • Procesamiento lingüístico que permite interpretar transcripciones, declaraciones testimoniales o intercambios digitales de información.
  • Revisión asistida por software para optimizar investigaciones.
  • Métodos avanzados para combatir fraudes.
  • Análisis instantáneo en tiempo real.

Día 03

Análisis escalable y en tiempo real mediante el entorno Hadoop

  • Razones por las cuales algoritmos tradicionales de análisis resultan poco eficaces bajo el ecosistema Hadoop/HDFS.
  • Apache Hama, plataforma orientada al cómputo distribuido sincronizado masivo.
  • Apache Spark destaca por su capacidad para procesar información en tiempo real y gestionar clusters de cálculo.
  • El laboratorio gráfico de la Universidad Carnegie Mellon emplea un modelo asíncrono basado en grafos para distribuir cargas computacionales.
  • Treeminer incorpora métodos algebraicos (KNN p) que reducen significativamente el requerimiento energético y coste operativo derivado del hardware utilizado.

Herramientas para eDiscovery y análisis forense digital

  • Comparativa económica y de eficiencia entre soluciones eDiscovery basadas en big data frente a métodos tradicionales aplicados a datos legacy.
  • Técnicas como la codificación predictiva y el análisis asistido por software (Technology Assisted Review, TAR).
  • Demostración en vivo de vMiner que ilustra cómo este software permite una identificación y clasificación mucho más rápida de contenidos relevantes.
  • Incremento notable del flujo de indexado mediante el uso eficiente de HDFS para gestionar gran cantidad de información en poco tiempo.
  • Procesamiento lingüístico natural (NLP): conjunto variado de productos y técnicas abiertas al desarrollo.
  • Soluciones tecnológicas capaces de analizar información generada en diversos idiomas extranjeros.

Aplicaciones del big data para la ciberseguridad: crear una visión integral, acelerar la recolección y clasificación de datos críticos para detectar amenazas

  • Introducción a los principios básicos del análisis de seguridad informática – superficie de ataque posible, desajustes en las configuraciones de seguridad o protecciones propias de cada dispositivo.
  • Infraestructura de redes y tuberías masivas para el rápido intercambio de datos, así como procesamiento instantáneo mediante módulos ETL especializados.
  • Distinción entre enfoques prescriptivos basados en reglas fijas frente a los sistemas que detectan automáticamente nuevos patrones de amenazas mediante el uso de metadatos.

Aglutinación y recolección variada de datos para el análisis forense criminal

  • Uso de dispositivos IoT como sensores encargados de registrar información relevante.
  • Fotografía satelital utilizada en vigilancia terrestre y reconocimiento geográfico.
  • Aplicación de sistemas de videovigilancia e imágenes para la identificación criminal.
  • Otras tecnologías recopiladoras: drones, cámaras corporales, geolocalización vía GPS o sensores térmicos.
  • Integración entre datos automáticamente extraídos mediante herramientas digitales y información generada por testigos, interrogatorios o investigaciones previas.
  • Predicción proactiva sobre posibles conductas delictivas futuras.

Día 04

Aplicación de soluciones BI basadas en big data para la prevención del fraude mediante el análisis avanzado de datos

  • Clasificaciones básicas del análisis antifraude: metodologías reglísticas frente a aquellas que incorporan componentes predictivos.
  • Comparativa entre aprendizaje automático supervisado y no supervisado, según su idoneidad en la detección de patrones irregulares típicos del fraude.
  • Ejemplos específicos abordados: fraudes entre empresas, reclamaciones médicas falsas, estafas aseguradoras, evasión tributaria y blanqueo de capitales.

Analítica aplicada a redes sociales: extracción y comprensión de inteligencia útil

  • Mecanismos que facilitan la organización, reclutamiento y planificación criminal mediante plataformas sociales.
  • API especializadas en big data diseñadas para capturar información dispersa generada por redes sociales.
  • Análisis diversificado: texto descriptivo, imágenes visuales, metadatos complementarios y contenido audiovisual.
  • Detección de tendencias emocionales presentes en publicaciones digitales.
  • Filtrado contextual de mensajes según su pertinencia temática o irrelevancia detectada mediante herramientas especializadas.
  • Dashboards interactivos que unifican y procesan múltiples fuentes sociales simultáneamente.
  • Perfilado automático de usuarios registrados en estas redes.
  • Cada concepto descrito será ilustrado paso a paso mediante la aplicación Treeminer.

Tecnologías de big data para el tratamiento digital de imágenes y videosecuencias

  • Formas modernas de almacenar información gráfica en entornos big data – soluciones adaptadas a conjuntos que superan la magnitud del petabyte.
  • Tecnologías complementarias como LTFS (Sistema de Archivos Lineal por Cinta) y LTO (Tecnología Abierta para Cintas Lineales).
  • Arquitectura GPFS-LTFS: combinación innovadora que permite almacenar información gráfica masiva con escalabilidad comprobada.
  • Noiones básicas sobre análisis visual computarizado.
  • Mecanismos automatizados para reconocimiento de elementos específicos dentro de imágenes.
  • Técnicas precisas de segmentación visual, descomponiendo la imagen en múltiples partes relevantes.
  • Seguimiento preciso de movimientos entre distintos fotogramas o secuencias.
  • Reconstrucción tridimensional a partir de planos bidimensionales previos.

Biotecnologías: datos biométricos, ADN y programas avanzados de identificación

  • Visión más allá del reconocimiento clásico mediante huellas dactilares o rostro.
  • Técnicas actuales como el análisis del habla, la detección única basada en patrones tipográficos al escribir y el CODIS (Sistema Combinado de Índices Genéticos).
  • Novedades fascinantes: uso forense del ADN que permite inferir rasgos faciales a partir únicamente de muestras genéticas analizadas.

Paneles dinámicos basados en big data para el acceso simplificado e integrado a información diversa:

  • Conexión entre plataformas existentes y paneles de visualización avanzada del big data.
  • Gestión integral del ciclo de vida de datos voluminosos generados por organizaciones.
  • Ejemplo concreto: casos prácticos mostrando Tableau o Pentaho integrándose eficientemente en flujos oficiales gubernamentales.
  • Uso estratégico de servicios de geolocalización respaldados por grandes volúmenes informativos en instituciones públicas.
  • Sistemas robustos para monitorear y controlar operaciones internas derivadas del flujo informativo.

Día 05

Metodologías para fundamentar económicamente la implementación de sistemas de BI basados en big data:

  • Cálculo exacto del retorno de inversión generado por este tipo de tecnologías.
  • Estudios de caso ilustrativos que demuestran cómo se reduce drásticamente el tiempo destinado a la recolección y depuración preliminar por parte de analistas, mejorando su productividad global.
  • Oportunidades sustanciales para disminuir los costes asociados a licencias de bases relacionales.
  • Generación directa de ingresos adicionales derivada del empleo creativo de servicios basados en posicionamiento geográfico.
  • Ahorro real generado gracias al mecanismo proactivo de detección y prevención de fraudes que estos sistemas implementan.
  • Uso combinado de hojas de cálculo y modelos cuantitativos para estimar gastos necesarios frente a ganancias económicas esperadas gracias a proyectos basados en big data.

Rutina ordenada para reemplazar gradualmente sistemas legacy mediante infraestructuras totalmente basadas en Big Data:

  • Planificación y cronograma completo asociado a la transición tecnológica.
  • Información previa crítica imprescindible para proyectar con precisión requerimientos hardware-software necesarios.
  • Métodos científicos reconocidos para cuantificar los indicadores clave de volumen, velocidad y variedad informativa disponible.
  • Estrategias fiables para pronosticar el crecimiento futuro del flujo de datos.
  • Análisis comparativo de estudios reales y casos exitosos documentados.

Reseña detallada sobre proveedores especializados en big data y descripciones precisas de sus productos ofrecidos:

  • Accenture
  • APTEAN (antes conocido como CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (antes 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (filial de EMC)

Sesión de preguntas y respuestas

Requerimientos

  • Conocimiento sobre los procesos policiales y sistemas de gestión de datos
  • Comprensión básica de SQL/Oracle o bases de datos relacionales
  • Conocimientos elementales de estadística (a nivel de hojas de cálculo)

Público objetivo

  • Especialistas policiales con formación técnica
 35 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 7250 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Reseñas (3)

Próximos cursos

Categorías Relacionadas