Temario del curso
Día 01
Resumen del Análisis de Inteligencia Criminal mediante Big Data Business Intelligence
- Estudios de caso de las fuerzas del orden - Patrullaje predictivo
- Tasa de adopción de Big Data en las agencias policiales y cómo están alineando sus operaciones futuras en torno al análisis predictivo de Big Data
- Soluciones tecnológicas emergentes como sensores de disparos, videos de vigilancia y redes sociales
- Uso de la tecnología de Big Data para mitigar la sobrecarga de información
- Interfaz de Big Data con datos heredados (Legacy)
- Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
- Integración de datos y visualización mediante paneles de control
- Gestión de fraude
- Reglas de negocio y detección de fraude
- Detección de amenazas y perfilamiento
- Análisis costo-beneficio para la implementación de Big Data
Introducción al Big Data
- Características principales del Big Data: Volumen, Variedad, Velocidad y Veracidad.
- Arquitectura MPP (Procesamiento Masivamente Paralelo)
- Data Warehouses - esquema estático, conjunto de datos que evoluciona lentamente
- Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop: sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
- Apache Spark para procesamiento en flujo (stream processing)
- Lote: adecuado para análisis no interactivo
- Volumen: datos en streaming CEP
- Opciones típicas - productos CEP (por ejemplo, Infostreams, Apama, MarkLogic, etc.)
- Menos preparados para producción - Storm/S4
- Bases de datos NoSQL (columnares y clave-valor): las más adecuadas como complemento analítico para almacenes/bases de datos de datos.
Soluciones NoSQL
- KV Store: Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Jerárquico): GT.m, Cache
- KV Store (Ordenado): TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store: Gigaspaces, Coord, Apache River
- Bases de datos de objetos: ZopeDB, DB40, Shoal
- Almacenes de documentos: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Almacenes columnares amplios: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de datos: Introducción a los problemas de limpieza de datos en el Big Data
- RDBMS - estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL - semiestructurado, tiene suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento.
- Problemas de limpieza de datos
Hadoop
- ¿Cuándo seleccionar Hadoop?
- ESTRUCTURADO: Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no es bueno para la exploración activa).
- Datos SEMIESTRUCTURADOS: difíciles de procesar con soluciones tradicionales (DW/DB).
- El almacenamiento en almacén de datos requiere UN GRAN esfuerzo y permanece estático incluso después de su implementación.
- Para variedad y volumen de datos, comprimidos en hardware comercial: HADOOP.
- Se necesita hardware comercial para crear un clúster de Hadoop.
Introducción a Map Reduce /HDFS
- MapReduce: distribución del cómputo en múltiples servidores.
- HDFS: disponibiliza los datos localmente para el proceso de cómputo (con redundancia).
- Datos: pueden ser no estructurados o sin esquema (a diferencia de RDBMS).
- Responsabilidad del desarrollador de dar sentido a los datos.
- Programación MapReduce implica trabajar con Java (pros/contras), cargando manualmente los datos en HDFS.
Día 02
Ecosistema de Big Data: Construcción de ETL de Big Data (Extraer, Transformar, Cargar): ¿Qué herramientas de Big Data utilizar y cuándo?
- Hadoop frente a otras soluciones NoSQL
- Para acceso interactivo y aleatorio a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
- No es bueno para análisis ad-hoc, sí para registro, conteo y series temporales.
- Sqoop: Importar desde bases de datos a Hive o HDFS (acceso JDBC/ODBC).
- Flume: Transmitir datos (por ejemplo, registros de eventos) a HDFS.
Sistema de gestión de Big Data
- Componentes móviles, nodos de cómputo que inician o fallan: ZooKeeper para servicios de configuración, coordinación y nombres.
- Pipeline/flujo de trabajo complejo: Oozie para gestionar el flujo de trabajo, dependencias y encadenamiento secuencial.
- Implementación, configuración, gestión del clúster, actualizaciones, etc. (administración de sistemas): Ambari.
- En la nube: Whirr.
Análisis Predictivo: Técnicas fundamentales e Inteligencia de Negocios basada en Aprendizaje Automático
- Introducción al Aprendizaje Automático
- Aprendizaje de técnicas de clasificación
- Predicción Bayesiana - preparación de un archivo de entrenamiento.
- Máquinas de soporte vectorial
- Álgebra de árboles-KNN y minería vertical
- Redes neuronales
- Problema de grandes variables en Big Data - Bosque aleatorio (RF).
- Problema de automatización en Big Data - Bosque aleatorio multi-modelo.
- Automatización mediante Soft10-M.
- Herramienta analítica de texto: Treeminer.
- Aprendizaje ágil.
- Aprendizaje basado en agentes.
- Aprendizaje distribuido.
- Introducción a herramientas open source para análisis predictivo: R, Python, Rapidminer, Mahout.
Ecosistema de Análisis Predictivo y su aplicación en el Análisis de Inteligencia Criminal
- Tecnología y proceso de investigación.
- Análisis de conocimientos (insight analytic).
- Análisis de visualización.
- Análisis predictivo estructurado.
- Análisis predictivo no estructurado.
- Perfilamiento de amenazas/fraudstar/proveedores.
- Motor de recomendación.
- Detección de patrones.
- Descubrimiento de reglas/escenarios: fallo, fraude, optimización.
- Descubrimiento de la causa raíz.
- Análisis de sentimiento.
- Análisis CRM.
- Análisis de redes.
- Análisis de texto para obtener conocimientos de transcripciones, declaraciones de testigos, conversaciones en internet, etc.
- Revisión asistida por tecnología.
- Análisis de fraude.
- Análisis en tiempo real.
Día 03
Análisis en Tiempo Real y Escalable sobre Hadoop
- ¿Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS?
- Apache Hama: para cómputo distribuido síncrono masivo.
- Apache SPARK: para cómputo en clúster y análisis en tiempo real.
- CMU Graphics Lab2: enfoque asíncrono basado en grafos para el cómputo distribuido.
- KNN p: Enfoque algebraico desde Treeminer para reducir el costo operativo del hardware.
Herramientas para eDiscovery y Forense
- eDiscovery sobre Big Data frente a datos heredados: una comparación de costos y rendimiento.
- Codificación predictiva y Revisión Asistida por Tecnología (TAR).
- Demostración en vivo de vMiner para comprender cómo TAR habilita un descubrimiento más rápido.
- Indexación más rápida a través de HDFS: Velocidad de los datos.
- PAN (Procesamiento del Lenguaje Natural): productos y técnicas open source.
- eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros.
Big Data BI para Ciberseguridad: Obtener una visión de 360 grados, recopilación rápida de datos e identificación de amenazas
- Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, mala configuración de seguridad, defensas de host.
- Infraestructura de red / Gran tubería de datos / ETL de respuesta para análisis en tiempo real.
- Predictivo frente prescriptivo: reglas fijas frente al descubrimiento automático de reglas de amenazas a partir de metadatos.
Recopilación de datos dispares para el Análisis de Inteligencia Criminal
- Uso de IoT (Internet de las Cosas) como sensores para capturar datos.
- Uso de imágenes satelitales para la vigilancia interna.
- Uso de datos de vigilancia e imágenes para la identificación criminal.
- Otras tecnologías de recopilación de datos: drones, cámaras corporales, sistemas de etiquetado GPS y tecnología de imagen térmica.
- Combinación de la recuperación automática de datos con datos obtenidos de informantes, interrogatorios e investigaciones.
- Pronóstico de actividad delictiva.
Día 04
Prevención de Fraude BI a partir de Big Data en el Análisis de Fraud
- Clasificación básica del Análisis de Fraude: basado en reglas frente analítico predictivo.
- Aprendizaje supervisado frente no supervisado para la detección de patrones de fraude.
- Fraude entre empresas, fraude en reclamaciones médicas, fraude de seguros, evasión fiscal y lavado de dinero.
Análisis de Redes Sociales: Recolección y análisis de inteligencia
- Cómo utilizan los criminales las redes sociales para organizar, reclutar y planificar.
- API de Big Data ETL para extraer datos de redes sociales.
- Texto, imagen, metadatos y video.
- Análisis de sentimiento desde el feed de redes sociales.
- Filtrado contextual y no contextual del feed de redes sociales.
- Panel de control de redes sociales para integrar diversas plataformas.
- Perfilamiento automatizado de perfiles en redes sociales.
- Se proporcionarán demostraciones en vivo de cada análisis a través de la herramienta Treeminer.
Análisis de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data: solución de almacenamiento para datos que exceden los petabytes.
- LTFS (Sistema de archivos de cinta lineal) y LTO (Cinta Lineal Abierta).
- GPFS-LTFS (Sistema de Archivos Paralelos General - Sistema de Archivos de Cinta Lineal): solución de almacenamiento en capas para grandes datos de imagen.
- Fundamentos del análisis de imágenes.
- Reconocimiento de objetos.
- Segmentación de imágenes.
- Rastreo de movimiento.
- Reconstrucción de imágenes 3D.
Biométrica, ADN y Programas de Identificación de Nueva Generación
- Más allá de las huellas dactilares y el reconocimiento facial.
- Reconocimiento de voz, análisis del patrón de tecleo (keystroke) y CODIS (Sistema Combinado de Índices de ADN).
- Más allá de la coincidencia de ADN: uso de la fenotipificación forense del ADN para construir un rostro a partir de muestras de ADN.
Panel de control de Big Data para el acceso rápido y visualización de datos diversos:
- Integración de la plataforma de aplicaciones existente con el panel de control de Big Data.
- Gestión de Big Data.
- Caso de estudio del panel de control de Big Data: Tableau y Pentaho.
- Uso de la aplicación de Big Data para impulsar servicios basados en la ubicación en el gobierno.
- Sistema de seguimiento y gestión.
Día 05
Cómo justificar la implementación de Big Data BI dentro de una organización:
- Definición del ROI (Retorno de Inversión) para implementar Big Data.
- Estudios de caso sobre el ahorro de tiempo del analista en la recopilación y preparación de datos, aumentando la productividad.
- Ganancia de ingresos por menor costo de licencias de bases de datos.
- Ganancia de ingresos por servicios basados en la ubicación.
- Ahorro de costos por prevención de fraude.
- Un enfoque integrado basado en hojas de cálculo para calcular los gastos aproximados frente a las ganancias/ahorro de ingresos por la implementación de Big Data.
Procedimiento paso a paso para reemplazar un sistema de datos heredado con un Sistema de Big Data
- Ruta crítica de migración de Big Data.
- ¿Qué información crítica se necesita antes de diseñar un sistema de Big Data?
- ¿Cuáles son las diferentes formas de calcular el Volumen, Velocidad, Variedad y Veracidad de los datos?
- Cómo estimar el crecimiento de datos.
- Estudios de caso.
Revisión de proveedores de Big Data y reseña de sus productos.
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte de EMC)
Sesión de preguntas y respuestas.
Requerimientos
- Conocimiento de los procesos de las fuerzas del orden y los sistemas de datos
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Comprensión básica de estadísticas (a nivel de hojas de cálculo)
Público objetivo
- Especialistas en fuerzas del orden con formación técnica
Reseñas (3)
fundamentos y amó los documentos y ejercicios preparados
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Curso - Introduction to Predictive AI
Traducción Automática
Que fue muy priactico.
Alfonso Ramos - Banco de Mexico
Curso - Fundamentos de Integración de Datos Pentaho
Deepthi estaba muy atenta a mis necesidades, podía percibir cuándo añadir capas de complejidad y cuándo mantenerse atrás y adoptar un enfoque más estructurado. Deepthi realmente trabajó a mi ritmo y aseguró que pudiera utilizar las nuevas funciones/herramientas por mí mismo, primero mostrándome y luego dejándome recrear los elementos por mí mismo, lo cual ayudó mucho a consolidar la formación. ¡No podría estar más satisfecho con los resultados de esta capacitación y con el nivel de experiencia de Deepthi!
Deepthi - Invest Northern Ireland
Curso - IBM Cognos Analytics
Traducción Automática