Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión dura 2 horas
Día 1: Sesión 1: Visión General de Negocios sobre por qué la Inteligencia de Negocios con Big Data en el Gobierno
- Estudios de Caso de NIH, DoE
- Tasa de adaptación de Big Data en Agencias Gubernamentales y cómo están alineando sus futuras operaciones en torno a la Analítica Predictiva de Big Data
- Áreas de Aplicación a Gran Escala en DoD, NSA, IRS, USDA, etc.
- Interfaz de Big Data con datos legacy
- Comprensión básica de las tecnologías habilitadoras en la analítica predictiva
- Integración de Datos y visualización en tableros (Dashboards)
- Gestión de fraudes
- Generación de Reglas de Negocio/Detección de Fraude
- Detección de amenazas y perfilado
- Análisis costo-beneficio para la implementación de Big Data
Día 1: Sesión 2: Introducción a Big Data-1
- Principales características de Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
- Almacenes de Datos – esquema estático, conjunto de datos que evoluciona lentamente
- Bases de Datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones Basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
- Por lotes (Batch) - apto para analítica/no interactiva
- Volumen: Datos de streaming CEP
- Elecciones típicas – productos CEP (e. ej., Infostreams, Apama, MarkLogic, etc.)
- Poco listo para producción – Storm/S4
- Bases de Datos NoSQL – (columnares y clave-valor): Mejor adecuadas como complemento analítico del almacén/bases de datos
Día 1: Sesión 3: Introducción a Big Data-2
Soluciones NoSQL
- Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- Almacén KV (Jerárquico) - GT.m, Cache
- Almacén KV (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Almacén de Tuplas - Gigaspaces, Coord, Apache River
- Base de Datos de Objetos - ZopeDB, DB40, Shoal
- Almacén de Documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Almacén de Columnas Anchas - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de Datos: Introducción al problema de Limpieza de Datos en Big Data
- RDBMS – estructura/esquema estático, no promueve un entorno ágil y exploratorio.
- NoSQL – semi-estructurado, suficiente estructura para almacenar datos sin un esquema exacto antes de almacenarlos
- Problemas de limpieza de datos
Día 1: Sesión 4: Introducción a Big Data-3: Hadoop
- ¿Cuándo seleccionar Hadoop?
- DATOS ESTRUCTURADOS - Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no es bueno para la exploración activa)
- Datos SEMI ESTRUCTURADOS – difíciles de manejar con soluciones tradicionales (DW/DB)
- Almacenamiento en almacén de datos = gran esfuerzo y estático incluso después de la implementación
- Para la variedad y el volumen de datos, procesados en hardware de consumo – HADOOP
- Se necesita hardware de consumo para crear un Clúster Hadoop
Introducción a Map Reduce /HDFS
- MapReduce – computación distribuida en múltiples servidores
- HDFS – hace los datos disponibles localmente para el proceso de cómputo (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador para dar sentido a los datos
- Programación MapReduce = trabajar con Java (pros/contras), carga manual de datos en HDFS
Día 2: Sesión 1: Ecosistema de Big Data-Construyendo ETL de Big Data: universo de Herramientas de Big Data-¿cuál usar y cuándo?
- Hadoop vs. Otras soluciones NoSQL
- Para acceso aleatorio interactivo a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
- No es bueno para analítica ad-hoc, bueno para registro, conteo, series temporales
- Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Datos de streaming (e. ej., datos de registro) en HDFS
Día 2: Sesión 2: Sistema de Gestión de Big Data
- Movimiento de partes, nodos de cómputo inicio/fallo: ZooKeeper - Para servicios de configuración/coordinación/nombramiento
- Pipeline/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias, cadena de tareas
- Despliegue, configuración, gestión de clúster, actualización, etc. (admin de sistemas): Ambari
- En la Nube: Whirr
Día 2: Sesión 3: Analítica predictiva en Inteligencia de Negocios -1: Técnicas Fundamentales y BI basado en Aprendizaje Automático:
- Introducción al Aprendizaje Automático
- Clasificación de técnicas de aprendizaje
- Predicción Bayesiana-preparación del archivo de entrenamiento
- Máquina de Vectores de Soporte (SVM)
- KNN álgebra p-Tree & minería vertical
- Red Neuronales
- Problema de variables grandes en Big Data-Bosques Aleatorios (RF)
- Problema de Automatización en Big Data – Ensemble multi-modelo RF
- Automatización a través de Soft10-M
- Herramienta de analítica de texto-Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a Herramientas de Código Abierto para analítica predictiva: R, Rapidminer, Mahut
Día 2: Sesión 4 Ecosistema de analítica predictiva-2: Problemas comunes de analítica predictiva en el Gobierno.
- Analítica de inteligencia
- Analítica de visualización
- Analítica predictiva estructurada
- Analítica predictiva no estructurada
- Perfilado de amenazas/fraude/proveedores
- Motor de Recomendaciones
- Detección de patrones
- Descubrimiento de Reglas/Escenarios –fallo, fraude, optimización
- Descubrimiento de causas raíz
- Análisis de sentimiento
- Analítica de CRM
- Analítica de red
- Analítica de texto
- Revisión asistida por tecnología
- Analítica de fraude
- Analítica en Tiempo Real
Día 3: Sesión 1: Analítica en Tiempo Real y Escalable sobre Hadoop
- Por qué los algoritmos de analítica comunes fallan en Hadoop/HDFS
- Apache Hama- para cómputo distribuido de Sincronización por Lotes
- Apache SPARK- para cómputo de clúster para analítica en tiempo real
- CMU Graphics Lab2- Enfoque asíncrono basado en grafos para cómputo distribuido
- Enfoque basado en KNN p-Algebra de Treeminer para reducir el costo de hardware de operación
Día 3: Sesión 2: Herramientas para eDiscovery y Forense
- eDiscovery sobre Big Data vs. Datos Legacy – una comparación de costo y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demostración en vivo de un producto Tar (vMiner) para entender cómo funciona la TAR para un descubrimiento más rápido
- Indexación más rápida a través de HDFS –velocidad de los datos
- NLP o Procesamiento del Lenguaje Natural –varias técnicas y productos de código abierto
- eDiscovery en idiomas extranjeros-tecnología para el procesamiento de idiomas extranjeros
Día 3: Sesión 3: Big Data BI para Ciberseguridad – Entendiendo la vista completa de 360 grados desde la rápida recopilación de datos hasta la identificación de amenazas
- Entendiendo los básicos de la analítica de seguridad-superficie de ataque, mala configuración de seguridad, defensas del host
- Infraestructura de red/Gran tubería de datos/ETL de Respuesta para analítica en tiempo real
- Prescriptivo vs predictivo – Basado en reglas fijas vs auto-descubrimiento de reglas de amenazas desde Metadatos
Día 3: Sesión 4: Big Data en USDA: Aplicación en Agricultura
- Introducción a IoT (Internet de las Cosas) para la agricultura-Big Data basado en sensores y control
- Introducción a la imagen satelital y su aplicación en la agricultura
- Integración de datos de sensores e imágenes para la fertilidad del suelo, recomendación de cultivo y pronóstico
- Seguro agrícola y Big Data
- Pronóstico de pérdida de cosechas
Día 4: Sesión 1: BI de prevención de fraudes desde Big Data en el Gobierno-Analítica de fraude:
- Clasificación básica de la analítica de fraudes- basada en reglas vs analítica predictiva
- Aprendizaje automático supervisado vs no supervisado para detección de patrones de fraude
- Fraude de proveedor/sobre facturación por proyectos
- Fraude en Medicare y Medicaid- técnicas de detección de fraude para el procesamiento de reclamos
- Fraude en reembolsos de viaje
- Fraude en reembolsos del IRS
- Se presentarán estudios de caso y demostraciones en vivo donde haya datos disponibles.
Día 4: Sesión 2: Analítica de Medios Sociales- Recopilación y análisis de inteligencia
- ETL API de Big Data para extraer datos de medios sociales
- Texto, imagen, metadatos y video
- Análisis de sentimiento desde el flujo de medios sociales
- Filtrado contextual y no contextual del flujo de medios sociales
- Tablero de Medios Sociales para integrar diversos medios sociales
- Perfilado automatizado del perfil de medios sociales
- Se dará una demostración en vivo de cada analítica a través de la Herramienta Treeminer.
Día 4: Sesión 3: Analítica de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de Almacenamiento de Imágenes en Big Data- Solución de almacenamiento para datos que exceden petabytes
- LTFS y LTO
- GPFS-LTFS (Solución de almacenamiento en capas para Big Data de imágenes)
- Fundamentos de analítica de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Seguimiento de movimiento
- Reconstrucción de imágenes 3-D
Día 4: Sesión 4: Aplicaciones de Big Data en NIH:
- Áreas emergentes de Bio-informática
- Meta-genómica y problemas de minería de Big Data
- Analítica Predictiva de Big Data para Farmacogenómica, Metabolómica y Proteómica
- Big Data en el proceso genómico aguas abajo
- Aplicación de la analítica predictiva de Big data en Salud Pública
Tablero de Big Data para accesibilidad rápida de datos diversos y visualización:
- Integración de la plataforma de aplicaciones existente con el Tablero de Big Data
- Gestión de Big Data
- Estudio de Caso de Tablero de Big Data: Tableau y Pentaho
- Usar la app de Big Data para impulsar servicios basados en ubicación en el Gobierno.
- Sistema de seguimiento y gestión
Día 5: Sesión 1: Cómo justificar la implementación de BI de Big Data dentro de una organización:
- Definiendo el ROI para la implementación de Big Data
- Estudios de caso para el ahorro de Tiempo del Analista para la recopilación y preparación de Datos –aumento en la ganancia de productividad
- Estudios de caso de ganancia de ingresos por el ahorro en el costo de la base de datos licenciada
- Ganancia de ingresos por servicios basados en ubicación
- Ahorro por prevención de fraudes
- Un enfoque integrado de hoja de cálculo para calcular el gasto aproximado vs. ganancia/ahorro de ingresos de la implementación de Big Data.
Día 5: Sesión 2: Procedimiento paso a paso para reemplazar el sistema de datos legacy por un Sistema de Big Data:
- Entendiendo el Mapa de Ruta práctico de Migración de Big Data
- ¿Cuál es la información importante necesaria antes de diseñar una implementación de Big Data?
- Cuáles son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos
- Cómo estimar el crecimiento de los datos
- Estudios de caso
Día 5: Sesión 4: Revisión de Proveedores de Big Data y revisión de sus productos. Sesión de Pregunta/Respuesta:
- Accenture
- APTEAN (Antes CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Antes 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte de EMC)
Requerimientos
- Conocimiento básico de las operaciones de negocios y los sistemas de datos del Gobierno en su área de especialización
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Comprensión básica de Estadística (a nivel de hoja de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática