Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión tiene una duración de 2 horas
Día 1: Sesión 1: Panorama Empresarial sobre el Porqué del Big Data y la Inteligencia de Negocios en el Gobierno
- Casos de estudio del NIH (Institutos Nacionales de Salud) y DoE (Departamento de Energía)
- Tasa de adopción de Big Data en agencias gubernamentales y cómo están alineando sus operaciones futuras en torno al Análisis Predictivo de Big Data
- Áreas amplias de aplicación en DoD (Departamento de Defensa), NSA (Agencia de Seguridad Nacional), IRS (Servicio de Impuestos Internos), USDA (Departamento de Agricultura de EE. UU.), etc.
- Interfaz de Big Data con datos legados
- Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
- Integración de datos y visualización en tableros de control (dashboards)
- Gestión del fraude
- Generación de reglas comerciales/detección de fraude
- Detección y perfilamiento de amenazas
- Análisis costo-beneficio para la implementación de Big Data
Día 1: Sesión 2: Introducción al Big Data - 1
- Características principales del Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP (Massively Parallel Processing) para el volumen.
- Data Warehouses (Almacenes de datos) – esquema estático, conjunto de datos que evoluciona lentamente
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (procesamiento), recuperación desde HDFS
- Lotes (Batch) – adecuados para análisis/no interactivos
- Volumen: Flujo de datos CEP (Procesamiento de Eventos Complejos)
- Opciones típicas – productos CEP (por ejemplo, Infostreams, Apama, MarkLogic, etc.)
- Menos preparados para producción – Storm/S4
- Bases de datos NoSQL – (columnares y clave-valor): más adecuadas como complemento analítico al almacén de datos/base de datos
Día 1: Sesión 3: Introducción al Big Data - 2
Soluciones NoSQL
- Almacén KV (Clave-Valor) - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB
- Almacén KV (Jerárquico) - GT.m, Cache
- Almacén KV (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracotta
- Almacén de Tuplas - Gigaspaces, Coord, Apache River
- Base de datos de objetos - ZopeDB, DB40, Shoal
- Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Preserve, Riak-Basho, Scalaris
- Almacén Columnar Ancho (Wide Columnar Store) - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de Datos: Introducción al problema de limpieza de datos en el Big Data
- RDBMS (Sistemas de Gestión de Bases de Datos Relacionales) – estructura/esquema estático, no promueve un entorno ágil y exploratorio.
- NoSQL – semiestructurado, suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento
- Problemas de limpieza de datos
Día 1: Sesión 4: Introducción al Big Data - 3: Hadoop
- ¿Cuándo seleccionar Hadoop?
- DATOS ESTRUCTURADOS – Los almacenes de datos/bases de datos empresariales pueden almacenar cantidades masivas de datos (a un costo) pero imponen estructura (no es ideal para exploración activa)
- DATOS SEMIESTRUCTURADOS – Difíciles de manejar con soluciones tradicionales (DW/DB)
- Almacenamiento en almacén de datos = Esfuerzo ENORME y estático incluso después de la implementación
- Para variedad y volumen de datos, procesados en hardware commodity (commodity H/W) – HADOOP
- Hardware commodity necesario para crear un clúster de Hadoop
Introducción a MapReduce /HDFS
- MapReduce – distribución del cálculo en múltiples servidores
- HDFS (Sistema de Archivos Distribuido de Hadoop) – hace que los datos estén disponibles localmente para el proceso de cómputo (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador de dar sentido a los datos
- Programación MapReduce = trabajo con Java (pros/contras), carga manual de datos en HDFS
Día 2: Sesión 1: Ecosistema de Big Data - Construcción de Big Data ETL: universo de herramientas de Big Data - ¿cuáles usar y cuándo?
- Hadoop vs. Otras soluciones NoSQL
- Para acceso interactivo y aleatorio a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
- No es ideal para analítica ad-hoc, bueno para registro de eventos (logging), conteo y series temporales
- Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Flujo de datos (por ejemplo, datos de registro) hacia HDFS
Día 2: Sesión 2: Sistema de Gestión de Big Data
- Componentes móviles, nodos de cómputo inician/fallan: ZooKeeper - Para servicios de configuración/coordinación/naming (nombrado)
- Pipeline/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias y cadena de margaritas (daisy chain)
- Despliegue, configuración, gestión de clústeres, actualización, etc. (administrador del sistema): Ambari
- En la Nube: Whirr
Día 2: Sesión 3: Analítica Predictiva en Inteligencia de Negocios - 1: Técnicas Fundamentales y BI basado en aprendizaje automático
- Introducción al Aprendizaje Automático (Machine Learning)
- Aprendizaje de técnicas de clasificación
- Predicción Bayesiana: preparación del archivo de entrenamiento
- Máquinas de Vectores de Soporte (Support Vector Machine)
- KNN, Álgebra p-Tree y minería vertical
- Red Neuronal
- Problema de grandes variables en Big Data - Bosque Aleatorio (RF)
- Problema de Automatización en Big Data – Bosque Aleatorio multi-modelo
- Automatización a través de Soft10-M
- Herramienta de analítica de texto - Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a herramientas open source para analítica predictiva: R, Rapidminer, Mahout
Día 2: Sesión 4: Ecosistema de Analítica Predictiva - 2: Problemas comunes de analítica predictiva en el Gobierno
- Analítica de percepción (insight)
- Analítica de visualización
- Analítica predictiva estructurada
- Analítica predictiva no estructurada
- Perfilamiento de amenazas/fraudulentos/proveedores
- Motor de recomendaciones
- Detección de patrones
- Detección de reglas/escenarios – fallo, fraude, optimización
- Detección de la causa raíz
- Análisis de sentimiento
- Analítica CRM (Gestión de Relaciones con el Cliente)
- Analítica de redes
- Analítica de texto
- Revisión asistida por tecnología
- Analítica de fraude
- Analítica en tiempo real
Día 3: Sesión 1: Analítica en Tiempo Real y Escalable sobre Hadoop
- ¿Por qué fallan los algoritmos de analítica comunes en Hadoop/HDFS?
- Apache Hama - para computación distribuida sincrónica masiva (Bulk Synchronous)
- Apache SPARK - para computación en clústeres de analítica en tiempo real
- Laboratorio de Gráficos CMU2 - Enfoque asíncrono basado en grafos para computación distribuida
- Enfoque basado en álgebra p-KNN desde Treeminer para reducir el costo operativo del hardware
Día 3: Sesión 2: Herramientas para eDiscovery y Forensia
- eDiscovery sobre Big Data vs. datos legados – una comparación de costos y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demostración en vivo de un producto TAR (vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
- Indexación más rápida a través de HDFS – velocidad de los datos
- PLN (Procesamiento del Lenguaje Natural) o NLP – varias técnicas y productos open source
- eDiscovery en idiomas extranjeros: tecnología para procesamiento de idiomas extranjeros
Día 3: Sesión 3: Inteligencia de Negocios de Big Data para Ciberseguridad - Comprender la visión completa de 360 grados desde la recopilación rápida de datos hasta la identificación de amenazas
- Comprensión de los fundamentos de la analítica de seguridad: superficie de ataque, configuración incorrecta de seguridad, defensas de host
- Infraestructura de red/gran tubería de datos (data pipe)/ETL de respuesta para analítica en tiempo real
- Prescriptivo vs. predictivo – Reglas fijas basadas en reglas vs. descubrimiento automático de reglas de amenaza a partir de metadatos
Día 3: Sesión 4: Big Data en el USDA: Aplicaciones en Agricultura
- Introducción al IoT (Internet de las Cosas) para agricultura: sensores basados en Big Data y control
- Introducción a la imagen satelital y sus aplicaciones en agricultura
- Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronósticos
- Seguros agrícolas y Big Data
- Pronóstico de pérdidas de cultivos
Día 4: Sesión 1: Prevención de Fraude BI desde Big Data en el Gobierno - Analítica de Fraude:
- Clasificación básica de la analítica de fraude: basada en reglas vs. analítica predictiva
- Aprendizaje supervisado vs. no supervisado para la detección de patrones de fraude
- Fraude de proveedores/cobros excesivos por proyectos
- Fraude en Medicare y Medicaid: técnicas de detección de fraude para el procesamiento de reclamaciones
- Fraudes en reembolsos de viajes
- Fraudes en reembolsos del IRS (Servicio de Impuestos Internos)
- Se brindarán estudios de casos y demostraciones en vivo siempre que los datos estén disponibles.
Día 4: Sesión 2: Analítica de Redes Sociales - Recopilación y análisis de inteligencia
- API ETL de Big Data para extraer datos de redes sociales
- Texto, imágenes, metadatos y video
- Análisis de sentimiento a partir del flujo de redes sociales
- Filtrado contextual y no contextual del flujo de redes sociales
- Tablero de control de Redes Sociales para integrar diversas redes sociales
- Perfilamiento automatizado perfiles de redes sociales
- Se brindará una demostración en vivo de cada analítica a través de la herramienta Treeminer.
Día 4: Sesión 3: Analítica de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data: soluciones de almacenamiento para datos que exceden petabytes
- LTFS y LTO
- GPFS-LTFS (Solución de almacenamiento en capas para datos de imágenes grandes)
- Fundamentos de la analítica de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Rastreo de movimiento
- Reconstrucción de imágenes 3-D
Día 4: Sesión 4: Aplicaciones de Big Data en el NIH:
- Áreas emergentes de bioinformática
- Metagenómica y problemas de minería de datos masivos
- Analítica predictiva de Big Data para Farmacogenómica, Metabolómica y Proteómica
- Big Data en el proceso genómico posterior (downstream)
- Aplicación de la analítica predictiva de Big Data en salud pública
Tablero de control de Big Data para acceso rápido y visualización de diversos datos:
- Integración de la plataforma de aplicaciones existente con el Tablero de control de Big Data
- Gestión de Big Data
- Caso de estudio del Tablero de control de Big Data: Tableau y Pentaho
- Uso de aplicaciones de Big Data para impulsar servicios basados en ubicación en el gobierno
- Sistema de seguimiento y gestión
Día 5: Sesión 1: Cómo justificar la implementación de Inteligencia de Negocios de Big Data dentro de una organización:
- Definición del ROI (Retorno de Inversión) para la implementación de Big Data
- Casos de estudio sobre el ahorro de tiempo de analistas para la recopilación y preparación de datos – aumento en la ganancia de productividad
- Casos de estudio de ganancia de ingresos mediante el ahorro de costos de bases de datos con licencia
- Ganancia de ingresos a partir de servicios basados en ubicación
- Ahorro derivado de la prevención del fraude
- Un enfoque integrado basado en hojas de cálculo para calcular los gastos aproximados frente a la ganancia/ahorro de ingresos de la implementación de Big Data.
Día 5: Sesión 2: Procedimiento paso a paso para reemplazar sistemas de datos legados por sistemas de Big Data:
- Comprensión del mapa de ruta práctico de migración de Big Data
- ¿Qué información importante se necesita antes de arquitectar una implementación de Big Data?
- ¿Cuáles son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos?
- ¿Cómo estimar el crecimiento de los datos?
- Casos de estudio
Día 5: Sesión 4: Revisión de proveedores de Big Data y reseña de sus productos. Sesión de preguntas y respuestas:
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte de EMC)
Requerimientos
- Conocimientos básicos sobre el funcionamiento empresarial y los sistemas de datos en el gobierno dentro de su dominio
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Comprensión básica de Estadística (a nivel de hojas de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática