Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión dura 2 horas
Día 1: Sesión 1: Visión general comercial de por qué la BI de Big Data en el Gobierno
- Casos de estudio de NIH, DoE
- Tasa de adaptación del Big Data en agencias gubernamentales y cómo están alineando su operación futura con la Analítica Predictiva de Big Data
- Áreas de aplicación a gran escala en DoD, NSA, IRS, USDA, etc.
- Interfaz de Big Data con datos heredados (Legacy)/li>
- Comprensión básica de las tecnologías habilitadoras en analítica predictiva
- Integración de datos y visualización de paneles (dashboards)
- Gestión de fraude
- Generación de reglas de negocio / detección de fraude
- Detección y perfilado de amenazas
- Análisis de costos y beneficios para la implementación de Big Data
Día 1: Sesión 2: Introducción a Big Data-1
- Principales características de Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
- Almacenes de datos (Data Warehouses) – esquema estático, conjunto de datos de evolución lenta
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
- Por lotes (Batch): adecuado para analítica no interactiva
- Volumen: datos de flujo continuo (streaming) CEP
- Opciones típicas – productos CEP (p. ej., Infostreams, Apama, MarkLogic, etc.)
- Menos listo para producción – Storm/S4
- Bases de datos NoSQL (columnares y clave-valor): Más adecuadas como complemento analítico al almacén de datos/base de datos
Día 1: Sesión 3: Introducción a Big Data-2
Soluciones NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Jerárquico) - GT.m, Cache
- KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Base de datos de objetos - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de Datos: Introducción al problema de limpieza de datos en Big Data
- RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL – semiestructurado, suficiente estructura para almacenar datos sin un esquema exacto antes de guardarlos
- Problemas de limpieza de datos
Día 1: Sesión 4: Introducción a Big Data-3: Hadoop
- ¿Cuándo seleccionar Hadoop?
- ESTRUCTURADO - Los almacenes de datos/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no bueno para exploración activa)
- Datos SEMIESTRUCTURADOS – difíciles de manejar con soluciones tradicionales (DW/DB)
- Almacenar datos = GRAN esfuerzo y estático incluso después de la implementación
- Para la variedad y el volumen de datos, procesados en hardware comercial – HADOOP
- Hardware comercial necesario para crear un clúster de Hadoop
Introducción a Map Reduce /HDFS
- MapReduce – computación distribuida en varios servidores
- HDFS – hace los datos disponibles localmente para el proceso de computación (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador de darle sentido a los datos
- Programación de MapReduce = trabajar con Java (pros/contras), carga manual de datos en HDFS
Día 2: Sesión 1: Ecosistema de Big Data – Construyendo ETL de Big Data: universo de herramientas de Big Data, ¿cuál usar y cuándo?
- Hadoop vs. Otras soluciones NoSQL
- Para acceso aleatorio interactivo a datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a datos pero con restricciones impuestas (máx. 1 PB)
- No bueno para analítica ad-hoc, bueno para registro, conteo, series temporales
- Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Datos de flujo (p. ej., datos de registro) a HDFS
Día 2: Sesión 2: Sistema de Gestión de Big Data
- Componentes en movimiento, inicio/fallos de nodos de cómputo: ZooKeeper – Para servicios de configuración/coordinación/nombrado
- Compleja tubería/flujo de trabajo: Oozie – gestionar flujo de trabajo, dependencias, cadena secuenciales
- Despliegue, configuración, gestión de clústeres, actualización, etc. (administrador de sistemas): Ambari
- En la nube: Whirr
Día 2: Sesión 3: Analítica predictiva en Business Intelligence-1: Técnicas fundamentales y BI basada en aprendizaje automático:
- Introducción al aprendizaje automático
- Técnicas de clasificación de aprendizaje
- Predicción bayesiana: preparación de archivo de entrenamiento
- Máquina de Vectores de Soporte (SVM)
- Álgebra p-Tree de KNN y minería vertical
- Red neuronal
- Problema de variables grandes en Big Data – Bosque aleatorio (RF)
- Problema de automatización en Big Data – Ensamble multimodelo RF
- Automatización mediante Soft10-M
- Herramienta de analítica de texto: Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a herramientas de código abierto para analítica predictiva: R, Rapidminer, Mahut
Día 2: Sesión 4 Ecosistema de analítica predictiva-2: Problemas comunes de analítica predictiva en el Gobierno.
- Analítica de información (Insight)
- Analítica de visualización
- Analítica predictiva estructurada
- Analítica predictiva no estructurada
- Perfilado de amenazas/fraudadores/proveedores
- Motor de recomendaciones
- Detección de patrones
- Descubrimiento de reglas/escenarios – falla, fraude, optimización
- Descubrimiento de causas raíz
- Análisis de sentimiento
- Analítica CRM
- Analítica de redes
- Análisis de texto
- Revisión asistida por tecnología
- Analítica de fraude
- Analítica en tiempo real
Día 3: Sesión 1: Analítica en tiempo real y escalable sobre Hadoop
- Por qué los algoritmos de análisis comunes fallan en Hadoop/HDFS
- Apache Hama – para computación distribuida de sincronización en masa
- Apache SPARK – para computación en clúster para analítica en tiempo real
- Laboratorio de Gráficos CMU2 – Enfoque asincrónico basado en grafos para la computación distribuida
- Enfoque basado en Álgebra p de KNN desde Treeminer para reducir costos de hardware de operación
Día 3: Sesión 2: Herramientas para eDiscovery y Forense
- eDiscovery sobre Big Data vs. datos heredados – una comparación de costo y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demostración en vivo de un producto TAR (vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
- Indexación más rápida a través de HDFS – velocidad de los datos
- NLP o procesamiento de lenguaje natural – diversas técnicas y productos de código abierto
- eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros
Día 3: Sesión 3: BI de Big Data para Ciberseguridad – Comprensión de la vista completa de 360 grados, desde la recopilación rápida de datos hasta la identificación de amenazas
- Comprensión de los básicos de la analítica de seguridad: superficie de ataque, mala configuración de seguridad, defensas del host
- Infraestructura de red / Gran tubería de datos / ETL de respuesta para analítica en tiempo real
- Prescriptiva vs. predictiva – Reglas fijas basadas en reglas vs. descubrimiento automático de reglas de amenazas desde Metadatos
Día 3: Sesión 4: Big Data en USDA: Aplicación en Agricultura
- Introducción a IoT (Internet de las Cosas) para la agricultura: Big Data basado en sensores y control
- Introducción a la imagen satelital y su aplicación en la agricultura
- Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronósticos
- Seguro agrícola y Big Data
- Pronóstico de pérdidas de cultivos
Día 4: Sesión 1: BI para prevención de fraudes desde Big Data en el Gobierno – Analítica de fraude:
- Clasificación básica de analítica de fraude: basada en reglas vs. analítica predictiva
- Aprendizaje automático supervisado vs. no supervisado para la detección de patrones de fraude
- Fraude de proveedores / cobro excesivo por proyectos
- Fraude en Medicare y Medicaid – técnicas de detección de fraude para el procesamiento de reclamaciones
- Fraudes en reembolsos de viaje
- Fraudes en reembolsos del IRS
- Se proporcionarán casos de estudio y demostraciones en vivo donde haya datos disponibles.
Día 4: Sesión 2: Analítica de Medios Sociales: Recopilación y análisis de inteligencia
- API de ETL de Big Data para extraer datos de medios sociales
- Texto, imagen, metadatos y video
- Análisis de sentimiento desde el feed de medios sociales
- Filtrado contextual y no contextual del feed de medios sociales
- Panel de Medios Sociales para integrar diversos medios sociales
- Perfilado automatizado del perfil de medios sociales
- Se dará una demostración en vivo de cada analítica a través de la Herramienta Treeminer.
Día 4: Sesión 3: Analítica de Big Data en procesamiento de imágenes y feeds de video
- Técnicas de almacenamiento de imágenes en Big Data: Solución de almacenamiento para datos que exceden los petabytes
- LTFS y LTO
- GPFS-LTFS (Solución de almacenamiento en capas para grandes datos de imagen)
- Fundamentos de la analítica de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Rastreo de movimiento
- Reconstrucción de imágenes 3D
Día 4: Sesión 4: Aplicaciones de Big Data en NIH:
- Áreas emergentes de Bioinformática
- Problemas de minería de Metagenómica y Big Data
- Analítica predictiva de Big Data para Farmacogenómica, Metabolómica y Proteómica
- Big Data en el proceso genómico aguas abajo
- Aplicación de la analítica predictiva de Big Data en salud pública
Panel de Big Data para acceso rápido a datos diversos y visualización:
- Integración de la plataforma de aplicaciones existente con el Panel de Big Data
- Gestión de Big Data
- Caso de estudio de Panel de Big Data: Tableau y Pentaho
- Uso de la app de Big Data para impulsar servicios basados en ubicación en el Gobierno.
- Sistema de seguimiento y gestión
Día 5: Sesión 1: Cómo justificar la implementación de BI de Big Data dentro de una organización:
- Definición del ROI para la implementación de Big Data
- Casos de estudio de ahorro de tiempo del analista para la recopilación y preparación de datos – aumento de la ganancia de productividad
- Casos de estudio de ganancia de ingresos por el ahorro en el costo de la base de datos licenciada
- Ganancia de ingresos de servicios basados en ubicación
- Ahorro por la prevención de fraudes
- Un enfoque integrado de hoja de cálculo para calcular el gasto aproximado vs. ganancia de ingresos/ahorros de la implementación de Big Data.
Día 5: Sesión 2: Procedimiento paso a paso para reemplazar el sistema de datos heredados por un sistema de Big Data:
- Comprensión de la Hoja de Ruta práctica de Migración a Big Data
- ¿Cuál es la información importante necesaria antes de diseñar una implementación de Big Data?
- ¿Cuáles son las diferentes formas de calcular el volumen, la velocidad, la variedad y la veracidad de los datos?
- Cómo estimar el crecimiento de los datos
- Casos de estudio
Día 5: Sesión 4: Revisión de proveedores de Big Data y revisión de sus productos. Sesión de preguntas y respuestas:
- Accenture
- APTEAN (Antes CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Antes 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte de EMC)
Requerimientos
- Conocimiento básico de la operación comercial y los sistemas de datos en el gobierno dentro de su dominio
- Comprensión básica de SQL/Oracle o base de datos relacional
- Comprensión básica de Estadística (a nivel de hoja de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática