Fundamentos de Apache Iceberg
Apache Iceberg es un formato de tabla de código abierto para conjuntos de datos a gran escala que aporta la fiabilidad y simplicidad de las tablas SQL al mundo del big data. Fue diseñado para resolver los desafíos de gestionar grandes volúmenes de datos en lagos de datos, que a menudo implican manejar esquemas complejos, archivos extensos y diversas fuentes de datos.
Esta formación en vivo impartida por un instructor (en línea o presencial) está dirigida a profesionales de datos de nivel principiante que desean adquirir los conocimientos y habilidades necesarios para utilizar eficazmente Apache Iceberg en la gestión de conjuntos de datos a gran escala, garantizar la integridad de los datos y optimizar los flujos de trabajo de procesamiento.
Al finalizar esta formación, los participantes serán capaces de:
- Obtener una comprensión profunda de la arquitectura, las características y los beneficios de Apache Iceberg.
- Aprender sobre formatos de tablas, particionamiento, evolución de esquemas y capacidades de viaje en el tiempo.
- Instalar y configurar Apache Iceberg en diferentes entornos.
- Crear, gestionar y manipular tablas Iceberg.
- Comprender el proceso de migración de datos desde otros formatos de tabla a Iceberg.
Formato del curso
- Conferencia interactiva y debate.
- Numerosos ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinarlo.
Temario del curso
Introducción a Apache Iceberg
- Descripción general de Apache Iceberg
- Importancia y casos de uso en la arquitectura de datos moderna
- Características clave y beneficios
Conceptos básicos
- Formato y arquitectura de tablas Iceberg
- Comparación con otros formatos de tabla
- Particionamiento y evolución del esquema
- Viaje en el tiempo y versionado de datos
Configuración de Apache Iceberg
- Instalación y configuración
- Integración de Iceberg con diversos motores de procesamiento de datos
- Configuración de un entorno Iceberg en una máquina local
Operaciones básicas
- Creación y gestión de tablas Iceberg
- Lectura y escritura en tablas Iceberg
- Operaciones CRUD básicas
Migración e integración de datos
- Migración de datos desde Hive y otros sistemas a Iceberg
- Integración con herramientas de BI
- Migración de un conjunto de datos de ejemplo a Iceberg
Optimización del rendimiento
- Técnicas de ajuste de rendimiento
- Optimización de consultas y escaneos de datos
- Optimización del rendimiento en Iceberg
Descripción general de características avanzadas
- Evolución de particiones y particionamiento oculto
- Evolución de tablas y cambios en el esquema
- Funciones de viaje en el tiempo y reversión
- Implementación de características avanzadas en Iceberg
Resumen y siguientes pasos
Requerimientos
- Familiaridad con conceptos como tablas, esquemas, particiones e ingesta de datos
- Conocimientos básicos de SQL
Público objetivo
- Ingenieros de datos
- Arquitectos de datos
- Analistas de datos
- Desarrolladores de software
Los cursos públicos requieren más de 5 participantes.
Fundamentos de Apache Iceberg - Reserva
Fundamentos de Apache Iceberg - Consulta
Fundamentos de Apache Iceberg - Solicitud de consultoría
Reseñas (1)
Ejercicios prácticos. La clase debería haber durado 5 días, pero los 3 días fueron útiles para aclarar muchas de las preguntas que tenía al trabajar con NiFi.
James - BHG Financial
Curso - Apache NiFi for Administrators
Traducción Automática
Próximos cursos
Cursos Relacionados
Apache Iceberg Avanzado
21 HorasEsta formación en vivo impartida por un instructor en Guatemala (en línea o presencial) está dirigida a profesionales de datos de nivel avanzado que desean optimizar los flujos de trabajo de procesamiento de datos, garantizar la integridad de los datos e implementar soluciones robustas de lakehouse que puedan manejar las complejidades de las aplicaciones modernas de big data.
Al finalizar esta formación, los participantes serán capaces de:
- Obtener una comprensión profunda de la arquitectura de Iceberg, incluida la gestión de metadatos y la disposición de archivos.
- Configurar Iceberg para obtener un rendimiento óptimo en diversos entornos e integrarlo con múltiples motores de procesamiento de datos.
- Gestionar tablas Iceberg a gran escala, realizar cambios complejos de esquema y manejar la evolución de particiones.
- Dominar técnicas para optimizar el rendimiento de las consultas y la eficiencia del escaneo de datos para conjuntos de datos grandes.
- Implementar mecanismos para garantizar la consistencia de los datos, gestionar garantías transaccionales y manejar fallos en entornos distribuidos.
Análisis de Big Data con Google Colab y Apache Spark
14 HorasEsta formación en vivo, impartida por un instructor en <ubicación> (en línea o presencial), está dirigida a científicos de datos e ingenieros de nivel intermedio que deseen utilizar Google Colab y Apache Spark para el procesamiento y análisis de big data.
Al finalizar esta formación, los participantes serán capaces de:
- Configurar un entorno de big data utilizando Google Colab y Spark.
- Procesar y analizar grandes conjuntos de datos de manera eficiente con Apache Spark.
- Visualizar big data en un entorno colaborativo.
- Integrar Apache Spark con herramientas basadas en la nube.
Inteligencia de Negocios de Big Data para Agencias del Gobierno
35 HorasLos avances tecnológicos y el creciente volumen de información están transformando la forma en que se realizan los negocios en muchas industrias, incluido el sector gubernamental. Las tasas de generación de datos y archivo digital por parte del gobierno están en aumento debido al rápido crecimiento de dispositivos móviles y aplicaciones, sensores y dispositivos inteligentes, soluciones de computación en la nube y portales orientados al ciudadano. A medida que la información digital se expande y se vuelve más compleja, la gestión, el procesamiento, el almacenamiento, la seguridad y la disposición de esta también se complican. Nuevas herramientas de captura, búsqueda, descubrimiento y análisis están ayudando a las organizaciones a obtener información valiosa a partir de sus datos no estructurados. El mercado gubernamental se encuentra en un punto de inflexión, tomando conciencia de que la información es un activo estratégico; por lo tanto, el gobierno debe proteger, aprovechar y analizar tanto la información estructurada como la no estructurada para servir mejor al público y cumplir con los requisitos de la misión. Mientras los líderes gubernamentales se esfuerzan por evolucionar hacia organizaciones impulsadas por datos para lograr exitosamente sus objetivos misionales, están sentando las bases para correlacionar las dependencias entre eventos, personas, procesos e información.
Las soluciones gubernamentales de alto valor se crearán mediante una mezcla de las tecnologías más disruptivas:
- Dispositivos y aplicaciones móviles
- Servicios en la nube
- Tecnologías de negocios sociales y redes sociales
- Big Data y analítica avanzada (analytics)
El Big Data es una de las soluciones inteligentes para la industria y permite al gobierno tomar mejores decisiones actuando sobre los patrones revelados mediante el análisis de grandes volúmenes de datos, tanto relacionados como no relacionados, y estructurados como no estructurados.
Sin embargo, lograr estos logros requiere mucho más que simplemente acumular cantidades masivas de datos. "Hacer sentido de estos volúmenes de Big Data requiere herramientas y tecnologías de vanguardia capaces de analizar y extraer conocimiento útil de flujos vastos y diversos de información", escribieron Tom Kalil y Fen Zhao de la Oficina de Política de Ciencia y Tecnología de la Casa Blanca en una publicación en el blog OSTP.
La Casa Blanca dio un paso hacia la ayuda a las agencias para encontrar estas tecnologías al establecer la Iniciativa Nacional de Investigación y Desarrollo de Big Data en 2012. Esta iniciativa incluyó más de $200 millones para aprovechar al máximo la explosión del Big Data y las herramientas necesarias para analizarlo.
Los desafíos que plantea el Big Data son casi tan abrumadores como su promesa es alentadora. Almacenar datos eficientemente es uno de estos desafíos. Como siempre, los presupuestos son ajustados, por lo que las agencias deben minimizar el precio por megabyte del almacenamiento y mantener los datos fácilmente accesibles para que los usuarios puedan obtenerlos cuando quieran y cómo lo necesiten. Realizar copias de seguridad de cantidades masivas de datos intensifica este desafío.
Analizar los datos de manera efectiva es otro gran desafío. Muchas agencias emplean herramientas comerciales que les permiten filtrar a través de montañas de datos, identificando tendencias que pueden ayudarles a operar con mayor eficiencia. (Un estudio reciente de MeriTalk reveló que los directivos de TI federales creen que el Big Data podría ayudar a las agencias a ahorrar más de $500 mil millones mientras también cumplen con los objetivos de la misión).
Las herramientas personalizadas de Big Data desarrolladas a medida también están permitiendo a las agencias abordar la necesidad de analizar sus datos. Por ejemplo, el Grupo de Analítica Computacional de Datos del Laboratorio Nacional Oak Ridge ha puesto su sistema de analítica de datos Piranha a disposición de otras agencias. El sistema ha ayudado a los investigadores médicos a encontrar un vínculo que pueda alertar a los médicos sobre aneurismas aórticos antes de que se manifiesten. También se utiliza para tareas más rutinarias, como filtrar currículos para conectar candidatos con gerentes de contratación.
Una Introducción Práctica al Análisis de Datos y Big Data - 3 Días
21 HorasLos participantes que completen este entrenamiento en vivo e impartido por un instructor en Guatemala adquirirán una comprensión práctica y del mundo real sobre Big Data, así como sobre sus tecnologías relacionadas, metodologías y herramientas.
Los participantes tendrán la oportunidad de poner en práctica estos conocimientos mediante ejercicios prácticos. La interacción grupal y los comentarios del instructor son componentes importantes de la clase.
El curso comienza con una introducción a los conceptos fundamentales de Big Data, luego avanza hacia los lenguajes de programación y las metodologías utilizadas para realizar el Análisis de Datos. Finalmente, discutimos las herramientas e infraestructura que permiten el almacenamiento de Big Data, el Procesamiento Distribuido y la Escalabilidad.
Big Data y Análisis Avanzado
42 HorasBig Data y Análisis Avanzado es la aplicación de técnicas y herramientas sofisticadas para analizar conjuntos de datos grandes y complejos, con el fin de obtener información accionable y tomar decisiones estratégicas.
Este entrenamiento en vivo, dirigido por un instructor (en línea o presencial), está dirigido a profesionales de datos de nivel avanzado que deseen aprovechar los métodos analíticos más modernos y las tecnologías de big data para análisis predictivo, prescriptivo y en tiempo real.
Al finalizar este entrenamiento, los participantes serán capaces de:
- Diseñar e implementar tuberías de procesamiento de datos a gran escala para datos estructurados y no estructurados.
- Aplicar técnicas avanzadas de aprendizaje automático y aprendizaje profundo en conjuntos masivos de datos.
- Aprovechar marcos de computación distribuida para análisis en tiempo real y transmisión de datos (streaming).
- Integrar el análisis de big data en sistemas de inteligencia empresarial y toma de decisiones.
Formato del curso
- Clases interactivas con discusión grupal.
- Práctica constante mediante ejercicios.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una capacitación personalizada para este curso, por favor contáctenos para coordinar los detalles.
Big Data Business Intelligence para análisis de inteligencia criminal
35 HorasEn esta formación presencial dirigida por un instructor en Guatemala, los participantes aprenderán a adoptar la mentalidad adecuada para abordar las tecnologías de Big Data, evaluar su impacto en los procesos y políticas existentes e implementar estas tecnologías con el fin de identificar actividades delictivas y prevenir la criminalidad. Se examinarán estudios de caso de organizaciones de aplicación de la ley de todo el mundo para obtener información sobre sus enfoques de adopción, desafíos y resultados.
Al finalizar esta formación, los participantes podrán:
- Combinar la tecnología Big Data con los procesos tradicionales de recopilación de datos para reconstruir una narrativa durante una investigación.
- Implementar soluciones industriales de almacenamiento y procesamiento de Big Data para el análisis de datos.
- Preparar una propuesta para la adopción de las herramientas y procesos más adecuados que permitan un enfoque basado en datos para las investigaciones criminales.
Apache NiFi para administradores
21 HorasApache NiFi es una plataforma de integración de datos y procesamiento de eventos basada en flujos, de código abierto. Permite el enrutamiento, la transformación y la mediación automática y en tiempo real entre sistemas diversos, con una interfaz de usuario web y un control fino.
Esta formación en vivo impartida por un instructor (presencial o remota) está dirigida a administradores e ingenieros de nivel intermedio que deseen desplegar, gestionar, asegurar y optimizar los flujos de datos de NiFi en entornos de producción.
Al finalizar esta formación, los participantes podrán:
- Instalar, configurar y mantener clústeres de Apache NiFi.
- Diseñar y gestionar flujos de datos desde múltiples fuentes y destinos.
- Implementar la automatización del flujo, lógica de enrutamiento y transformación.
- Optimizar el rendimiento, monitorear las operaciones y solucionar problemas.
Formato del Curso
- Conferencia interactiva con discusión sobre arquitectura en el mundo real.
- Laboratorios prácticos: construcción, despliegue y gestión de flujos.
- Ejercicios basados en escenarios en un entorno de laboratorio en vivo.
Opciones de Personalización del Curso
- Para solicitar una formación personalizada para este curso, por favor contáctenos para organizarlo.
PySpark y Aprendizaje Automático
21 HorasEste curso ofrece una introducción práctica para construir flujos de trabajo escalables de procesamiento de datos y aprendizaje automático utilizando PySpark. Los participantes aprenderán cómo Apache Spark funciona dentro de los ecosistemas modernos de Big Data y cómo procesar grandes conjuntos de datos de manera eficiente mediante principios de computación distribuida.
Fundamentos de Apache Spark
21 HorasEsta formación en vivo impartida por un instructor en <ubicación> (en línea o presencial) está dirigida a ingenieros que desean configurar e implementar el sistema Apache Spark para procesar cantidades muy grandes de datos.
Al finalizar esta formación, los participantes serán capaces de:
- Instalar y configurar Apache Spark.
- Procesar y analizar rápidamente conjuntos de datos muy grandes.
- Comprender la diferencia entre Apache Spark y Hadoop MapReduce y cuándo utilizar cada uno.
- Integrar Apache Spark con otras herramientas de aprendizaje automático (machine learning).
Administración de Apache Spark
35 HorasEsta formación en vivo con instructor en Guatemala (en línea o presencial) está dirigida a administradores de sistemas de nivel principiante e intermedio que desean implementar, mantener y optimizar clústeres de Spark.
Al finalizar esta capacitación, los participantes podrán:
- Instalar y configurar Apache Spark en diversos entornos.
- Gestionar los recursos del clúster y supervisar las aplicaciones de Spark.
- Optimizar el rendimiento de los clústeres de Spark.
- Implementar medidas de seguridad y garantizar alta disponibilidad.
- Depurar y solucionar problemas comunes de Spark.
Apache Spark en la Nube
21 HorasLa curva de aprendizaje de Apache Spark es lenta al principio, y se requiere un esfuerzo significativo para obtener los primeros resultados. Este curso tiene como objetivo superar esa primera etapa desafiante. Al completar este curso, los participantes comprenderán los fundamentos de Apache Spark, podrán diferenciar claramente entre RDD y DataFrame, aprenderán las APIs de Python y Scala, entenderán ejecutores y tareas, entre otros conceptos. Además, siguiendo las mejores prácticas, el curso se enfoca fuertemente en la implementación en la nube, Databricks y AWS. Los estudiantes también comprenderán las diferencias entre AWS EMR y AWS Glue, uno de los servicios más recientes de Spark ofrecidos por AWS.
PÚBLICO OBJETIVO:
Ingenieros de Datos, DevOps, Científicos de Datos
Python y Spark para Big Data (PySpark)
21 HorasEn esta formación en vivo con instructor en Guatemala, los participantes aprenderán cómo utilizar Python y Spark juntos para analizar Big Data mientras realizan ejercicios prácticos.
Al finalizar esta capacitación, los participantes serán capaces de:
- Aprender cómo usar Spark con Python para analizar Big Data.
- Realizar ejercicios que imitan casos del mundo real.
- Utilizar diferentes herramientas y técnicas para el análisis de Big Data mediante PySpark.
Python, Spark y Hadoop para Big Data
21 HorasEsta formación impartida por un instructor en Guatemala (en línea o presencial) está dirigida a desarrolladores que deseen utilizar e integrar Spark, Hadoop y Python para procesar, analizar y transformar conjuntos de datos grandes y complejos.
Al finalizar esta formación, los participantes serán capaces de:
- Configurar el entorno necesario para comenzar a procesar big data con Spark, Hadoop y Python.
- Comprender las características, componentes principales y arquitectura de Spark y Hadoop.
- Aprender cómo integrar Spark, Hadoop y Python para el procesamiento de big data.
- Explorar las herramientas del ecosistema de Spark (Spark MLlib, Spark Streaming, Kafka, Sqoop, Flume).
- Construir sistemas de recomendación basados en filtrado colaborativo similares a los utilizados por Netflix, YouTube, Amazon, Spotify y Google.
- Utilizar Apache Mahout para escalar algoritmos de aprendizaje automático.
Stratio: Módulos Rocket e Intelligence con PySpark
14 HorasStratio es una plataforma centrada en los datos que integra big data, inteligencia artificial (IA) y gobernanza en una única solución. Sus módulos Rocket e Intelligence permiten explorar, transformar y analizar datos de manera avanzada en entornos empresariales.
Esta formación impartida por un instructor (en línea o presencial) está dirigida a profesionales de datos con nivel intermedio que deseen utilizar eficazmente los módulos Rocket e Intelligence de Stratio junto con PySpark, centrándose en estructuras de bucle, funciones definidas por el usuario y lógica avanzada de datos.
Al finalizar esta formación, los participantes serán capaces de:
- Navegar y trabajar dentro de la plataforma Stratio utilizando los módulos Rocket e Intelligence.
- Aplicar PySpark en el contexto de ingestión, transformación y análisis de datos.
- Utilizar bucles y lógica condicional para controlar flujos de trabajo y tareas de ingeniería de características.
- Crear y gestionar funciones definidas por el usuario (UDF) para operaciones de datos reutilizables en PySpark.
Formato del curso
- Conferencia interactiva y discusión.
- Muchos ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinarla.