Contacta con nosotros

Temario del curso

Cada sesión tiene una duración de 2 horas

Día 1: Sesión 1: Panorama Empresarial sobre el Porqué del Big Data y la Inteligencia de Negocios en el Gobierno

  • Casos de estudio del NIH (Institutos Nacionales de Salud) y DoE (Departamento de Energía)
  • Tasa de adopción de Big Data en agencias gubernamentales y cómo están alineando sus operaciones futuras en torno al Análisis Predictivo de Big Data
  • Áreas amplias de aplicación en DoD (Departamento de Defensa), NSA (Agencia de Seguridad Nacional), IRS (Servicio de Impuestos Internos), USDA (Departamento de Agricultura de EE. UU.), etc.
  • Interfaz de Big Data con datos legados
  • Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
  • Integración de datos y visualización en tableros de control (dashboards)
  • Gestión del fraude
  • Generación de reglas comerciales/detección de fraude
  • Detección y perfilamiento de amenazas
  • Análisis costo-beneficio para la implementación de Big Data

Día 1: Sesión 2: Introducción al Big Data - 1

  • Características principales del Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP (Massively Parallel Processing) para el volumen.
  • Data Warehouses (Almacenes de datos) – esquema estático, conjunto de datos que evoluciona lentamente
  • Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
  • Patrón típico: HDFS, MapReduce (procesamiento), recuperación desde HDFS
  • Lotes (Batch) – adecuados para análisis/no interactivos
  • Volumen: Flujo de datos CEP (Procesamiento de Eventos Complejos)
  • Opciones típicas – productos CEP (por ejemplo, Infostreams, Apama, MarkLogic, etc.)
  • Menos preparados para producción – Storm/S4
  • Bases de datos NoSQL – (columnares y clave-valor): más adecuadas como complemento analítico al almacén de datos/base de datos

Día 1: Sesión 3: Introducción al Big Data - 2

Soluciones NoSQL

  • Almacén KV (Clave-Valor) - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB
  • Almacén KV (Jerárquico) - GT.m, Cache
  • Almacén KV (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracotta
  • Almacén de Tuplas - Gigaspaces, Coord, Apache River
  • Base de datos de objetos - ZopeDB, DB40, Shoal
  • Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Preserve, Riak-Basho, Scalaris
  • Almacén Columnar Ancho (Wide Columnar Store) - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variedades de Datos: Introducción al problema de limpieza de datos en el Big Data

  • RDBMS (Sistemas de Gestión de Bases de Datos Relacionales) – estructura/esquema estático, no promueve un entorno ágil y exploratorio.
  • NoSQL – semiestructurado, suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento
  • Problemas de limpieza de datos

Día 1: Sesión 4: Introducción al Big Data - 3: Hadoop

  • ¿Cuándo seleccionar Hadoop?
  • DATOS ESTRUCTURADOS – Los almacenes de datos/bases de datos empresariales pueden almacenar cantidades masivas de datos (a un costo) pero imponen estructura (no es ideal para exploración activa)
  • DATOS SEMIESTRUCTURADOS – Difíciles de manejar con soluciones tradicionales (DW/DB)
  • Almacenamiento en almacén de datos = Esfuerzo ENORME y estático incluso después de la implementación
  • Para variedad y volumen de datos, procesados en hardware commodity (commodity H/W) – HADOOP
  • Hardware commodity necesario para crear un clúster de Hadoop

Introducción a MapReduce /HDFS

  • MapReduce – distribución del cálculo en múltiples servidores
  • HDFS (Sistema de Archivos Distribuido de Hadoop) – hace que los datos estén disponibles localmente para el proceso de cómputo (con redundancia)
  • Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
  • Responsabilidad del desarrollador de dar sentido a los datos
  • Programación MapReduce = trabajo con Java (pros/contras), carga manual de datos en HDFS

Día 2: Sesión 1: Ecosistema de Big Data - Construcción de Big Data ETL: universo de herramientas de Big Data - ¿cuáles usar y cuándo?

  • Hadoop vs. Otras soluciones NoSQL
  • Para acceso interactivo y aleatorio a los datos
  • Hbase (base de datos orientada a columnas) sobre Hadoop
  • Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
  • No es ideal para analítica ad-hoc, bueno para registro de eventos (logging), conteo y series temporales
  • Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
  • Flume – Flujo de datos (por ejemplo, datos de registro) hacia HDFS

Día 2: Sesión 2: Sistema de Gestión de Big Data

  • Componentes móviles, nodos de cómputo inician/fallan: ZooKeeper - Para servicios de configuración/coordinación/naming (nombrado)
  • Pipeline/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias y cadena de margaritas (daisy chain)
  • Despliegue, configuración, gestión de clústeres, actualización, etc. (administrador del sistema): Ambari
  • En la Nube: Whirr

Día 2: Sesión 3: Analítica Predictiva en Inteligencia de Negocios - 1: Técnicas Fundamentales y BI basado en aprendizaje automático

  • Introducción al Aprendizaje Automático (Machine Learning)
  • Aprendizaje de técnicas de clasificación
  • Predicción Bayesiana: preparación del archivo de entrenamiento
  • Máquinas de Vectores de Soporte (Support Vector Machine)
  • KNN, Álgebra p-Tree y minería vertical
  • Red Neuronal
  • Problema de grandes variables en Big Data - Bosque Aleatorio (RF)
  • Problema de Automatización en Big Data – Bosque Aleatorio multi-modelo
  • Automatización a través de Soft10-M
  • Herramienta de analítica de texto - Treeminer
  • Aprendizaje ágil
  • Aprendizaje basado en agentes
  • Aprendizaje distribuido
  • Introducción a herramientas open source para analítica predictiva: R, Rapidminer, Mahout

Día 2: Sesión 4: Ecosistema de Analítica Predictiva - 2: Problemas comunes de analítica predictiva en el Gobierno

  • Analítica de percepción (insight)
  • Analítica de visualización
  • Analítica predictiva estructurada
  • Analítica predictiva no estructurada
  • Perfilamiento de amenazas/fraudulentos/proveedores
  • Motor de recomendaciones
  • Detección de patrones
  • Detección de reglas/escenarios – fallo, fraude, optimización
  • Detección de la causa raíz
  • Análisis de sentimiento
  • Analítica CRM (Gestión de Relaciones con el Cliente)
  • Analítica de redes
  • Analítica de texto
  • Revisión asistida por tecnología
  • Analítica de fraude
  • Analítica en tiempo real

Día 3: Sesión 1: Analítica en Tiempo Real y Escalable sobre Hadoop

  • ¿Por qué fallan los algoritmos de analítica comunes en Hadoop/HDFS?
  • Apache Hama - para computación distribuida sincrónica masiva (Bulk Synchronous)
  • Apache SPARK - para computación en clústeres de analítica en tiempo real
  • Laboratorio de Gráficos CMU2 - Enfoque asíncrono basado en grafos para computación distribuida
  • Enfoque basado en álgebra p-KNN desde Treeminer para reducir el costo operativo del hardware

Día 3: Sesión 2: Herramientas para eDiscovery y Forensia

  • eDiscovery sobre Big Data vs. datos legados – una comparación de costos y rendimiento
  • Codificación predictiva y revisión asistida por tecnología (TAR)
  • Demostración en vivo de un producto TAR (vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
  • Indexación más rápida a través de HDFS – velocidad de los datos
  • PLN (Procesamiento del Lenguaje Natural) o NLP – varias técnicas y productos open source
  • eDiscovery en idiomas extranjeros: tecnología para procesamiento de idiomas extranjeros

Día 3: Sesión 3: Inteligencia de Negocios de Big Data para Ciberseguridad - Comprender la visión completa de 360 grados desde la recopilación rápida de datos hasta la identificación de amenazas

  • Comprensión de los fundamentos de la analítica de seguridad: superficie de ataque, configuración incorrecta de seguridad, defensas de host
  • Infraestructura de red/gran tubería de datos (data pipe)/ETL de respuesta para analítica en tiempo real
  • Prescriptivo vs. predictivo – Reglas fijas basadas en reglas vs. descubrimiento automático de reglas de amenaza a partir de metadatos

Día 3: Sesión 4: Big Data en el USDA: Aplicaciones en Agricultura

  • Introducción al IoT (Internet de las Cosas) para agricultura: sensores basados en Big Data y control
  • Introducción a la imagen satelital y sus aplicaciones en agricultura
  • Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronósticos
  • Seguros agrícolas y Big Data
  • Pronóstico de pérdidas de cultivos

Día 4: Sesión 1: Prevención de Fraude BI desde Big Data en el Gobierno - Analítica de Fraude:

  • Clasificación básica de la analítica de fraude: basada en reglas vs. analítica predictiva
  • Aprendizaje supervisado vs. no supervisado para la detección de patrones de fraude
  • Fraude de proveedores/cobros excesivos por proyectos
  • Fraude en Medicare y Medicaid: técnicas de detección de fraude para el procesamiento de reclamaciones
  • Fraudes en reembolsos de viajes
  • Fraudes en reembolsos del IRS (Servicio de Impuestos Internos)
  • Se brindarán estudios de casos y demostraciones en vivo siempre que los datos estén disponibles.

Día 4: Sesión 2: Analítica de Redes Sociales - Recopilación y análisis de inteligencia

  • API ETL de Big Data para extraer datos de redes sociales
  • Texto, imágenes, metadatos y video
  • Análisis de sentimiento a partir del flujo de redes sociales
  • Filtrado contextual y no contextual del flujo de redes sociales
  • Tablero de control de Redes Sociales para integrar diversas redes sociales
  • Perfilamiento automatizado perfiles de redes sociales
  • Se brindará una demostración en vivo de cada analítica a través de la herramienta Treeminer.

Día 4: Sesión 3: Analítica de Big Data en procesamiento de imágenes y flujos de video

  • Técnicas de almacenamiento de imágenes en Big Data: soluciones de almacenamiento para datos que exceden petabytes
  • LTFS y LTO
  • GPFS-LTFS (Solución de almacenamiento en capas para datos de imágenes grandes)
  • Fundamentos de la analítica de imágenes
  • Reconocimiento de objetos
  • Segmentación de imágenes
  • Rastreo de movimiento
  • Reconstrucción de imágenes 3-D

Día 4: Sesión 4: Aplicaciones de Big Data en el NIH:

  • Áreas emergentes de bioinformática
  • Metagenómica y problemas de minería de datos masivos
  • Analítica predictiva de Big Data para Farmacogenómica, Metabolómica y Proteómica
  • Big Data en el proceso genómico posterior (downstream)
  • Aplicación de la analítica predictiva de Big Data en salud pública

Tablero de control de Big Data para acceso rápido y visualización de diversos datos:

  • Integración de la plataforma de aplicaciones existente con el Tablero de control de Big Data
  • Gestión de Big Data
  • Caso de estudio del Tablero de control de Big Data: Tableau y Pentaho
  • Uso de aplicaciones de Big Data para impulsar servicios basados en ubicación en el gobierno
  • Sistema de seguimiento y gestión

Día 5: Sesión 1: Cómo justificar la implementación de Inteligencia de Negocios de Big Data dentro de una organización:

  • Definición del ROI (Retorno de Inversión) para la implementación de Big Data
  • Casos de estudio sobre el ahorro de tiempo de analistas para la recopilación y preparación de datos – aumento en la ganancia de productividad
  • Casos de estudio de ganancia de ingresos mediante el ahorro de costos de bases de datos con licencia
  • Ganancia de ingresos a partir de servicios basados en ubicación
  • Ahorro derivado de la prevención del fraude
  • Un enfoque integrado basado en hojas de cálculo para calcular los gastos aproximados frente a la ganancia/ahorro de ingresos de la implementación de Big Data.

Día 5: Sesión 2: Procedimiento paso a paso para reemplazar sistemas de datos legados por sistemas de Big Data:

  • Comprensión del mapa de ruta práctico de migración de Big Data
  • ¿Qué información importante se necesita antes de arquitectar una implementación de Big Data?
  • ¿Cuáles son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos?
  • ¿Cómo estimar el crecimiento de los datos?
  • Casos de estudio

Día 5: Sesión 4: Revisión de proveedores de Big Data y reseña de sus productos. Sesión de preguntas y respuestas:

  • Accenture
  • APTEAN (anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (anteriormente 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (parte de EMC)

Requerimientos

  • Conocimientos básicos sobre el funcionamiento empresarial y los sistemas de datos en el gobierno dentro de su dominio
  • Comprensión básica de SQL/Oracle o bases de datos relacionales
  • Comprensión básica de Estadística (a nivel de hojas de cálculo)
 35 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas