Contacta con nosotros

Temario del curso

Introducción

Comprensión del Big Data

Visión general de Spark

Visión general de Python

Visión general de PySpark

  • Distribución de datos utilizando el marco Resilient Distributed Datasets (RDD).
  • Distribución del cómputo utilizando operadores de la API de Spark.

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendizaje de los fundamentos de la programación en Python

  • Iniciando con Python.
  • Uso del cuaderno Jupyter (Jupyter Notebook).
  • Uso de variables y tipos de datos simples.
  • Trabajo con listas.
  • Uso de sentencias if.
  • Interacción con entradas de usuario.
  • Trabajo con bucles while.
  • Implementación de funciones.
  • Trabajo con clases.
  • Manejo de archivos y excepciones.
  • Trabajo con proyectos, datos y APIs.

Aprendizaje de los fundamentos de Spark DataFrame

  • Iniciando con Spark DataFrames.
  • Implementación de operaciones básicas con Spark.
  • Uso de operaciones Groupby (agrupar por) y agregadas.
  • Trabajo con marcas de tiempo y fechas.

Desarrollo de un ejercicio de proyecto con Spark DataFrame

Comprensión del aprendizaje automático (Machine Learning) con MLlib

Trabajo con MLlib, Spark y Python para Machine Learning

Comprensión de las regresiones

  • Aprendizaje de la teoría de la regresión lineal.
  • Implementación de un código de evaluación de regresión.
  • Ejercicio de práctica con una regresión lineal de muestra.
  • Aprendizaje de la teoría de la regresión logística.
  • Implementación de un código de regresión logística.
  • Ejercicio de práctica con una regresión logística de muestra.

Comprensión de los bosques aleatorios (Random Forests) y los árboles de decisión

  • Aprendizaje de la teoría de métodos de árboles.
  • Implementación de códigos de árboles de decisión y bosques aleatorios.
  • Ejercicio de práctica con clasificación de bosque aleatorio de muestra.

Trabajo con agrupamiento K-means

  • Comprensión de la teoría del agrupamiento K-means.
  • Implementación de un código de agrupamiento K-means.
  • Ejercicio de práctica con clustering de muestra.

Trabajo con sistemas de recomendación

Implementación de procesamiento del lenguaje natural

  • Comprensión del Procesamiento del Lenguaje Natural (NLP).
  • Visión general de herramientas NLP.
  • Ejercicio de práctica con NLP de muestra.

Transmisión de datos (Streaming) con Spark en Python

  • Visión general de transmisión de datos con Spark.
  • Ejercicio de práctica de streaming de Spark de muestra.

Observaciones finales

Requerimientos

  • Habilidades generales de programación.

Público objetivo

  • Desarrolladores.
  • Profesionales de TI.
  • Científicos de datos.
 21 Horas

Número de participantes


Precio por participante

Reseñas (6)

Próximos cursos

Categorías Relacionadas