Ponte en Contacto

Temario del curso

Fundamentos de la Plataforma Databricks y Lakehouse

  • Arquitectura y componentes del Lakehouse de Databricks.
  • Organización de áreas de trabajo y catálogos.

Área de Trabajo de Databricks y Cuadernos (Notebooks)

  • Navegación del área de trabajo y desarrollo basado en cuadernos.
  • Estructuración del código en cuadernos reutilizables.

Arquitectura y Ejecución de Apache Spark

  • Arquitectura del entorno de ejecución de Spark y modelo de ejecución.
  • Evaluación perezosa (lazy evaluation) y el DAG de trabajos.

DataFrames de PySpark y la API de DataFrames

  • Abstracciones de DataFrames y esquemas.
  • Operaciones principales de DataFrames y expresiones de columnas.

Traducción de SQL a DataFrames de PySpark

  • Traducción de cláusulas principales de SQL a operaciones de DataFrame.
  • Funciones de ventana y agregaciones en PySpark.

Lectura y Escritura de Datos en Databricks

  • Lectura desde fuentes comunes de archivos y bases de datos.
  • Escribir y particionar datos en el Lakehouse.

Delta Lake y Gestión de Tablas

  • Tablas Delta y transacciones ACID.
  • Time travel (viaje en el tiempo) y evolución del esquema.

Patrones de Limpieza y Transformación de Datos

  • Limpieza de datos y conversión de tipos.
  • Creación de lógica de transformación reutilizable.

Funciones Definidas por el Usuario (UDF) y Código Modular

  • Python UDFs y pandas UDFs.
  • Modularización de lógica procedural en funciones.

Afinamiento del Rendimiento y Optimización

  • Estrategias de particionamiento y almacenamiento en caché (caching).
  • Diagnóstico de cuellos de botella mediante la interfaz de usuario de Spark.

Fundamentos de Streaming Estructurado

  • Modelos de procesamiento por lotes versus streaming.
  • DataFrames en streaming y agregaciones básicas.

Trabajos de Databricks y Orquestación de Flujos de Trabajo

  • Programación de cuadernos como trabajos y tareas.
  • Creación de flujos de trabajo multinivel con dependencias.

Unity Catalog y Gobernanza de Datos

  • Arquitectura y espacios de nombres de Unity Catalog.
  • Control de acceso y linaje de datos.

Pruebas, Depuración y Prácticas de Producción

  • Pruebas unitarias de la lógica en PySpark.
  • Depuración y estándares de calidad del código.

Casos de Uso Extremos en Servicios Financieros

  • Construcción de un pipeline ETL bancario extremo a extremo.
  • Traducción de procesos heredados de SQL a PySpark.

Migración de Cargas de Trabajo SQL a PySpark

  • Estrategia de migración y patrones de planificación.
  • Conversión incremental de flujos de trabajo SQL a PySpark.

Requerimientos

  • Experiencia con programación en Python, incluyendo funciones y tipos de datos.
  • Conocimientos de SQL, incluyendo joins (uniones), agregaciones y subconsultas.
  • No se requiere experiencia previa en Databricks o PySpark.

Audiencia Objetivo

  • Ingenieros de datos, analistas de datos y profesionales del sector de datos.
  • Equipos que migran flujos de trabajo basados en SQL existentes a Databricks y PySpark.
 35 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas