Contacta con nosotros

Temario del curso

Día 01

Resumen del Análisis de Inteligencia Criminal mediante Big Data Business Intelligence

  • Estudios de caso de las fuerzas del orden - Patrullaje predictivo
  • Tasa de adopción de Big Data en las agencias policiales y cómo están alineando sus operaciones futuras en torno al análisis predictivo de Big Data
  • Soluciones tecnológicas emergentes como sensores de disparos, videos de vigilancia y redes sociales
  • Uso de la tecnología de Big Data para mitigar la sobrecarga de información
  • Interfaz de Big Data con datos heredados (Legacy)
  • Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
  • Integración de datos y visualización mediante paneles de control
  • Gestión de fraude
  • Reglas de negocio y detección de fraude
  • Detección de amenazas y perfilamiento
  • Análisis costo-beneficio para la implementación de Big Data

Introducción al Big Data

  • Características principales del Big Data: Volumen, Variedad, Velocidad y Veracidad.
  • Arquitectura MPP (Procesamiento Masivamente Paralelo)
  • Data Warehouses - esquema estático, conjunto de datos que evoluciona lentamente
  • Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluciones basadas en Hadoop: sin condiciones sobre la estructura del conjunto de datos.
  • Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
  • Apache Spark para procesamiento en flujo (stream processing)
  • Lote: adecuado para análisis no interactivo
  • Volumen: datos en streaming CEP
  • Opciones típicas - productos CEP (por ejemplo, Infostreams, Apama, MarkLogic, etc.)
  • Menos preparados para producción - Storm/S4
  • Bases de datos NoSQL (columnares y clave-valor): las más adecuadas como complemento analítico para almacenes/bases de datos de datos.

Soluciones NoSQL

  • KV Store: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Jerárquico): GT.m, Cache
  • KV Store (Ordenado): TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store: Gigaspaces, Coord, Apache River
  • Bases de datos de objetos: ZopeDB, DB40, Shoal
  • Almacenes de documentos: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Almacenes columnares amplios: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variedades de datos: Introducción a los problemas de limpieza de datos en el Big Data

  • RDBMS - estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
  • NoSQL - semiestructurado, tiene suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento.
  • Problemas de limpieza de datos

Hadoop

  • ¿Cuándo seleccionar Hadoop?
  • ESTRUCTURADO: Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no es bueno para la exploración activa).
  • Datos SEMIESTRUCTURADOS: difíciles de procesar con soluciones tradicionales (DW/DB).
  • El almacenamiento en almacén de datos requiere UN GRAN esfuerzo y permanece estático incluso después de su implementación.
  • Para variedad y volumen de datos, comprimidos en hardware comercial: HADOOP.
  • Se necesita hardware comercial para crear un clúster de Hadoop.

Introducción a Map Reduce /HDFS

  • MapReduce: distribución del cómputo en múltiples servidores.
  • HDFS: disponibiliza los datos localmente para el proceso de cómputo (con redundancia).
  • Datos: pueden ser no estructurados o sin esquema (a diferencia de RDBMS).
  • Responsabilidad del desarrollador de dar sentido a los datos.
  • Programación MapReduce implica trabajar con Java (pros/contras), cargando manualmente los datos en HDFS.

Día 02

Ecosistema de Big Data: Construcción de ETL de Big Data (Extraer, Transformar, Cargar): ¿Qué herramientas de Big Data utilizar y cuándo?

  • Hadoop frente a otras soluciones NoSQL
  • Para acceso interactivo y aleatorio a los datos
  • Hbase (base de datos orientada a columnas) sobre Hadoop
  • Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
  • No es bueno para análisis ad-hoc, sí para registro, conteo y series temporales.
  • Sqoop: Importar desde bases de datos a Hive o HDFS (acceso JDBC/ODBC).
  • Flume: Transmitir datos (por ejemplo, registros de eventos) a HDFS.

Sistema de gestión de Big Data

  • Componentes móviles, nodos de cómputo que inician o fallan: ZooKeeper para servicios de configuración, coordinación y nombres.
  • Pipeline/flujo de trabajo complejo: Oozie para gestionar el flujo de trabajo, dependencias y encadenamiento secuencial.
  • Implementación, configuración, gestión del clúster, actualizaciones, etc. (administración de sistemas): Ambari.
  • En la nube: Whirr.

Análisis Predictivo: Técnicas fundamentales e Inteligencia de Negocios basada en Aprendizaje Automático

  • Introducción al Aprendizaje Automático
  • Aprendizaje de técnicas de clasificación
  • Predicción Bayesiana - preparación de un archivo de entrenamiento.
  • Máquinas de soporte vectorial
  • Álgebra de árboles-KNN y minería vertical
  • Redes neuronales
  • Problema de grandes variables en Big Data - Bosque aleatorio (RF).
  • Problema de automatización en Big Data - Bosque aleatorio multi-modelo.
  • Automatización mediante Soft10-M.
  • Herramienta analítica de texto: Treeminer.
  • Aprendizaje ágil.
  • Aprendizaje basado en agentes.
  • Aprendizaje distribuido.
  • Introducción a herramientas open source para análisis predictivo: R, Python, Rapidminer, Mahout.

Ecosistema de Análisis Predictivo y su aplicación en el Análisis de Inteligencia Criminal

  • Tecnología y proceso de investigación.
  • Análisis de conocimientos (insight analytic).
  • Análisis de visualización.
  • Análisis predictivo estructurado.
  • Análisis predictivo no estructurado.
  • Perfilamiento de amenazas/fraudstar/proveedores.
  • Motor de recomendación.
  • Detección de patrones.
  • Descubrimiento de reglas/escenarios: fallo, fraude, optimización.
  • Descubrimiento de la causa raíz.
  • Análisis de sentimiento.
  • Análisis CRM.
  • Análisis de redes.
  • Análisis de texto para obtener conocimientos de transcripciones, declaraciones de testigos, conversaciones en internet, etc.
  • Revisión asistida por tecnología.
  • Análisis de fraude.
  • Análisis en tiempo real.

Día 03

Análisis en Tiempo Real y Escalable sobre Hadoop

  • ¿Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS?
  • Apache Hama: para cómputo distribuido síncrono masivo.
  • Apache SPARK: para cómputo en clúster y análisis en tiempo real.
  • CMU Graphics Lab2: enfoque asíncrono basado en grafos para el cómputo distribuido.
  • KNN p: Enfoque algebraico desde Treeminer para reducir el costo operativo del hardware.

Herramientas para eDiscovery y Forense

  • eDiscovery sobre Big Data frente a datos heredados: una comparación de costos y rendimiento.
  • Codificación predictiva y Revisión Asistida por Tecnología (TAR).
  • Demostración en vivo de vMiner para comprender cómo TAR habilita un descubrimiento más rápido.
  • Indexación más rápida a través de HDFS: Velocidad de los datos.
  • PAN (Procesamiento del Lenguaje Natural): productos y técnicas open source.
  • eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros.

Big Data BI para Ciberseguridad: Obtener una visión de 360 grados, recopilación rápida de datos e identificación de amenazas

  • Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, mala configuración de seguridad, defensas de host.
  • Infraestructura de red / Gran tubería de datos / ETL de respuesta para análisis en tiempo real.
  • Predictivo frente prescriptivo: reglas fijas frente al descubrimiento automático de reglas de amenazas a partir de metadatos.

Recopilación de datos dispares para el Análisis de Inteligencia Criminal

  • Uso de IoT (Internet de las Cosas) como sensores para capturar datos.
  • Uso de imágenes satelitales para la vigilancia interna.
  • Uso de datos de vigilancia e imágenes para la identificación criminal.
  • Otras tecnologías de recopilación de datos: drones, cámaras corporales, sistemas de etiquetado GPS y tecnología de imagen térmica.
  • Combinación de la recuperación automática de datos con datos obtenidos de informantes, interrogatorios e investigaciones.
  • Pronóstico de actividad delictiva.

Día 04

Prevención de Fraude BI a partir de Big Data en el Análisis de Fraud

  • Clasificación básica del Análisis de Fraude: basado en reglas frente analítico predictivo.
  • Aprendizaje supervisado frente no supervisado para la detección de patrones de fraude.
  • Fraude entre empresas, fraude en reclamaciones médicas, fraude de seguros, evasión fiscal y lavado de dinero.

Análisis de Redes Sociales: Recolección y análisis de inteligencia

  • Cómo utilizan los criminales las redes sociales para organizar, reclutar y planificar.
  • API de Big Data ETL para extraer datos de redes sociales.
  • Texto, imagen, metadatos y video.
  • Análisis de sentimiento desde el feed de redes sociales.
  • Filtrado contextual y no contextual del feed de redes sociales.
  • Panel de control de redes sociales para integrar diversas plataformas.
  • Perfilamiento automatizado de perfiles en redes sociales.
  • Se proporcionarán demostraciones en vivo de cada análisis a través de la herramienta Treeminer.

Análisis de Big Data en procesamiento de imágenes y flujos de video

  • Técnicas de almacenamiento de imágenes en Big Data: solución de almacenamiento para datos que exceden los petabytes.
  • LTFS (Sistema de archivos de cinta lineal) y LTO (Cinta Lineal Abierta).
  • GPFS-LTFS (Sistema de Archivos Paralelos General - Sistema de Archivos de Cinta Lineal): solución de almacenamiento en capas para grandes datos de imagen.
  • Fundamentos del análisis de imágenes.
  • Reconocimiento de objetos.
  • Segmentación de imágenes.
  • Rastreo de movimiento.
  • Reconstrucción de imágenes 3D.

Biométrica, ADN y Programas de Identificación de Nueva Generación

  • Más allá de las huellas dactilares y el reconocimiento facial.
  • Reconocimiento de voz, análisis del patrón de tecleo (keystroke) y CODIS (Sistema Combinado de Índices de ADN).
  • Más allá de la coincidencia de ADN: uso de la fenotipificación forense del ADN para construir un rostro a partir de muestras de ADN.

Panel de control de Big Data para el acceso rápido y visualización de datos diversos:

  • Integración de la plataforma de aplicaciones existente con el panel de control de Big Data.
  • Gestión de Big Data.
  • Caso de estudio del panel de control de Big Data: Tableau y Pentaho.
  • Uso de la aplicación de Big Data para impulsar servicios basados en la ubicación en el gobierno.
  • Sistema de seguimiento y gestión.

Día 05

Cómo justificar la implementación de Big Data BI dentro de una organización:

  • Definición del ROI (Retorno de Inversión) para implementar Big Data.
  • Estudios de caso sobre el ahorro de tiempo del analista en la recopilación y preparación de datos, aumentando la productividad.
  • Ganancia de ingresos por menor costo de licencias de bases de datos.
  • Ganancia de ingresos por servicios basados en la ubicación.
  • Ahorro de costos por prevención de fraude.
  • Un enfoque integrado basado en hojas de cálculo para calcular los gastos aproximados frente a las ganancias/ahorro de ingresos por la implementación de Big Data.

Procedimiento paso a paso para reemplazar un sistema de datos heredado con un Sistema de Big Data

  • Ruta crítica de migración de Big Data.
  • ¿Qué información crítica se necesita antes de diseñar un sistema de Big Data?
  • ¿Cuáles son las diferentes formas de calcular el Volumen, Velocidad, Variedad y Veracidad de los datos?
  • Cómo estimar el crecimiento de datos.
  • Estudios de caso.

Revisión de proveedores de Big Data y reseña de sus productos.

  • Accenture
  • APTEAN (anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (anteriormente 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (parte de EMC)

Sesión de preguntas y respuestas.

Requerimientos

  • Conocimiento de los procesos de las fuerzas del orden y los sistemas de datos
  • Comprensión básica de SQL/Oracle o bases de datos relacionales
  • Comprensión básica de estadísticas (a nivel de hojas de cálculo)

Público objetivo

  • Especialistas en fuerzas del orden con formación técnica
 35 Horas

Número de participantes


Precio por participante

Reseñas (3)

Próximos cursos

Categorías Relacionadas