Temario del curso
Introducción, objetivos y estrategia de migración
- Objetivos del curso, alineación con el perfil de los participantes y criterios de éxito
- Enfoques de migración a alto nivel y consideraciones de riesgos
- Configuración de espacios de trabajo, repositorios y conjuntos de datos de laboratorio
Día 1 — Fundamentos de migración y arquitectura
- Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks
- Diferencias entre SMP y MPP e implicaciones para la migración
- Diseño Medalla (Bronce→Plata→Oro) y visión general de Unity Catalog
Laboratorio del Día 1 — Traducción de un procedimiento almacenado
- Migración práctica de un procedimiento almacenado de muestra a un cuaderno (notebook)
- Mapeo de tablas temporales y cursores a transformaciones de DataFrame
- Validación y comparación con la salida original
Día 2 — Delta Lake avanzado y carga incremental
- Transacciones ACID, registros de comisión (commit logs), control de versiones y viaje en el tiempo
- Auto Loader, patrones de MERGE INTO, operaciones de upsert y evolución de esquema
- OPTIMIZE, VACUUM, Z-ORDER, particionamiento y ajuste de almacenamiento
Laboratorio del Día 2 — Ingesta incremental y optimización
- Implementación de ingesta con Auto Loader y flujos de trabajo MERGE
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados
- Medición de mejoras en el rendimiento de lectura y escritura
Día 3 — SQL en Databricks, rendimiento y depuración
- Funciones SQL analíticas: funciones de ventana, funciones de orden superior, manejo de JSON/arrays
- Lectura de Spark UI, DAGs, mezclas (shuffles), etapas, tareas y diagnóstico de cuellos de botella
- Patrones de ajuste de consultas: uniones en difusión (broadcast joins), sugerencias (hints), caché y reducción de derrames (spill)
Laboratorio del Día 3 — Refactorización de SQL y ajuste de rendimiento
- Refactorización de un proceso SQL pesado en SQL de Spark optimizado
- Uso de trazas de Spark UI para identificar y corregir problemas de sesgo (skew) y mezcla (shuffle)
- Benchmarking antes y después y documentación de los pasos de ajuste
Día 4 — PySpark táctico: Reemplazo de la lógica procedural
- Modelo de ejecución de Spark: conductor, ejecutores, evaluación perezosa y estrategias de particionamiento
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrame
- Modularización, UDFs/UDFs de pandas, widgets y librerías reutilizables
Laboratorio del Día 4 — Refactorización de scripts procedurales
- Refactorización de un script ETL procedural en cuadernos modulares de PySpark
- Introducción de parametrización, pruebas de estilo unitario y funciones reutilizables
- Revisión de código y aplicación de una lista de verificación de mejores prácticas
Día 5 — Orquestación, tubería de extremo a extremo y mejores prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, desencadenantes y manejo de errores
- Diseño de tuberías Medalla incrementales con reglas de calidad y validación de esquemas
- Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para lógica de PySpark
Laboratorio del Día 5 — Construcción de una tubería completa de extremo a extremo
- Ensamblaje de la tubería Bronce→Plata→Oro orquestada con Workflows
- Implementación de registros (logging), auditoría, reintentos y validaciones automatizadas
- Ejecución de la tubería completa, validación de salidas y preparación de notas de despliegue
Operacionalización, gobernanza y preparación para producción
- Gobernanza de Unity Catalog, linaje y mejores prácticas de controles de acceso
- Costos, dimensionamiento de clústeres, escalado automático y patrones de concurrencia de trabajos
- Listas de verificación de despliegue, estrategias de retroceso (rollback) y creación de libros de operaciones (runbooks)
Revisión final, transferencia de conocimientos y próximos pasos
- Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación
- Referencias, rutas de aprendizaje adicionales y opciones de soporte
Requerimientos
- Comprensión de los conceptos de ingeniería de datos
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server)
- Conocimiento de los conceptos de orquestación ETL (ADF o similares)
Audiencia
- Gestores de tecnología con antecedentes en ingeniería de datos
- Ingenieros de datos que transicionan la lógica procedural de OLAP a patrones de Lakehouse
- Ingenieros de plataforma responsables de la adopción de Databricks
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.