Temario del curso
Fundamentos de la Plataforma Databricks y Lakehouse
- Arquitectura y componentes del Lakehouse de Databricks.
- Organización de áreas de trabajo y catálogos.
Área de Trabajo de Databricks y Cuadernos (Notebooks)
- Navegación del área de trabajo y desarrollo basado en cuadernos.
- Estructuración del código en cuadernos reutilizables.
Arquitectura y Ejecución de Apache Spark
- Arquitectura del entorno de ejecución de Spark y modelo de ejecución.
- Evaluación perezosa (lazy evaluation) y el DAG de trabajos.
DataFrames de PySpark y la API de DataFrames
- Abstracciones de DataFrames y esquemas.
- Operaciones principales de DataFrames y expresiones de columnas.
Traducción de SQL a DataFrames de PySpark
- Traducción de cláusulas principales de SQL a operaciones de DataFrame.
- Funciones de ventana y agregaciones en PySpark.
Lectura y Escritura de Datos en Databricks
- Lectura desde fuentes comunes de archivos y bases de datos.
- Escribir y particionar datos en el Lakehouse.
Delta Lake y Gestión de Tablas
- Tablas Delta y transacciones ACID.
- Time travel (viaje en el tiempo) y evolución del esquema.
Patrones de Limpieza y Transformación de Datos
- Limpieza de datos y conversión de tipos.
- Creación de lógica de transformación reutilizable.
Funciones Definidas por el Usuario (UDF) y Código Modular
- Python UDFs y pandas UDFs.
- Modularización de lógica procedural en funciones.
Afinamiento del Rendimiento y Optimización
- Estrategias de particionamiento y almacenamiento en caché (caching).
- Diagnóstico de cuellos de botella mediante la interfaz de usuario de Spark.
Fundamentos de Streaming Estructurado
- Modelos de procesamiento por lotes versus streaming.
- DataFrames en streaming y agregaciones básicas.
Trabajos de Databricks y Orquestación de Flujos de Trabajo
- Programación de cuadernos como trabajos y tareas.
- Creación de flujos de trabajo multinivel con dependencias.
Unity Catalog y Gobernanza de Datos
- Arquitectura y espacios de nombres de Unity Catalog.
- Control de acceso y linaje de datos.
Pruebas, Depuración y Prácticas de Producción
- Pruebas unitarias de la lógica en PySpark.
- Depuración y estándares de calidad del código.
Casos de Uso Extremos en Servicios Financieros
- Construcción de un pipeline ETL bancario extremo a extremo.
- Traducción de procesos heredados de SQL a PySpark.
Migración de Cargas de Trabajo SQL a PySpark
- Estrategia de migración y patrones de planificación.
- Conversión incremental de flujos de trabajo SQL a PySpark.
Requerimientos
- Experiencia con programación en Python, incluyendo funciones y tipos de datos.
- Conocimientos de SQL, incluyendo joins (uniones), agregaciones y subconsultas.
- No se requiere experiencia previa en Databricks o PySpark.
Audiencia Objetivo
- Ingenieros de datos, analistas de datos y profesionales del sector de datos.
- Equipos que migran flujos de trabajo basados en SQL existentes a Databricks y PySpark.
Reseñas (2)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.
Sandra Mariela Lopez Bernal - Kueski
Curso - Databricks
Me gustó que fuera práctico. Amé aplicar el conocimiento teórico con ejemplos prácticos.
Aurelia-Adriana - Allianz Services Romania
Curso - Python and Spark for Big Data (PySpark)
Traducción Automática