Ponte en Contacto

Temario del curso

Introducción:

  • Apache Spark en el ecosistema Hadoop
  • Introducción breve a Python y Scala

Fundamentos (teoría):

  • Arquitectura
  • RDD
  • Transformaciones y Acciones
  • Etapa (Stage), Tarea, Dependencias

Comprender los fundamentos utilizando el entorno Databricks (taller práctico):

  • Ejercicios usando la API de RDD
  • Funciones básicas de acción y transformación
  • PairRDD
  • Uniones (Join)
  • Estrategias de caché
  • Ejercicios usando la API de DataFrame
  • SparkSQL
  • DataFrame: selección, filtrado, agrupación, ordenamiento
  • UDF (Función Definida por el Usuario)
  • Exploración de la API de DataSet
  • Streaming

Comprender la implementación utilizando el entorno AWS (taller práctico):

  • Conceptos básicos de AWS Glue
  • Comprender las diferencias entre AWS EMR y AWS Glue
  • Ejemplos de trabajos en ambos entornos
  • Comprensión de ventajas y desventajas

Adicional:

  • Introducción a la orquestación con Apache Airflow

Requerimientos

Habilidades de programación (preferiblemente Python, Scala)

Conceptos básicos de SQL

 21 Horas

Número de participantes


Precio por participante

Reseñas (3)

Próximos cursos

Categorías Relacionadas