Contacta con nosotros

Temario del curso

Introducción

Comprensión de Big Data

Vista general de Spark

Vista general de Python

Vista general de PySpark

  • Distribución de datos utilizando el marco de trabajo de Conjuntos de Datos Distribuidos Resilientes (RDD).
  • Distribución del procesamiento mediante operadores de la API de Spark.

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendizaje de los fundamentos de la programación en Python

  • Iniciarse con Python.
  • Uso del cuaderno Jupyter (Jupyter Notebook).
  • Uso de variables y tipos de datos simples.
  • Trabajo con listas.
  • Uso de sentencias condicionales if.
  • Gestión de entradas de usuario.
  • Trabajo con bucles while.
  • Implementación de funciones.
  • Trabajo con clases.
  • Manejo de archivos y excepciones.
  • Trabajo con proyectos, datos y APIs.

Aprendizaje de los fundamentos de DataFrames en Spark

  • Iniciarse con DataFrames de Spark.
  • Implementación de operaciones básicas con Spark.
  • Uso de operaciones groupby (agrupar) y agregadas.
  • Trabajo con marcas de tiempo y fechas.

Ejercicio práctico en un proyecto de DataFrame con Spark

Comprensión del aprendizaje automático (Machine Learning) con MLlib

Trabajo con MLlib, Spark y Python para Machine Learning

Comprensión de las regresiones

  • Aprendizaje de la teoría de la regresión lineal.
  • Implementación de código para evaluar la regresión.
  • Ejercicio práctico de ejemplo sobre regresión lineal.
  • Aprendizaje de la teoría de la regresión logística.
  • Implementación de código de regresión logística.
  • Ejercicio práctico de ejemplo sobre regresión logística.

Comprensión de los bosques aleatorios (Random Forests) y árboles de decisión

  • Aprendizaje de la teoría de métodos de árboles.
  • Implementación de códigos para árboles de decisión y bosques aleatorios.
  • Ejercicio práctico de ejemplo sobre clasificación con bosques aleatorios.

Trabajo con clustering (agrupamiento) K-means

  • Comprensión de la teoría del clustering K-means.
  • Implementación de código para clustering K-means.
  • Ejercicio práctico de ejemplo sobre agrupamiento.

Trabajo con sistemas de recomendación

Implementación de procesamiento de lenguaje natural (PLN)

  • Comprensión del procesamiento de lenguaje natural (PLN o NLP).
  • Vista general de herramientas de PLN.
  • Ejercicio práctico de ejemplo de PLN.

Transmisión de datos en tiempo real con Spark en Python

  • Vista general de la transmisión (streaming) con Spark.
  • Ejercicio práctico de ejemplo de streaming con Spark.

Comentarios de cierre

Requerimientos

  • Habilidades generales de programación.

Público objetivo

  • Desarrolladores.
  • Profesionales de TI.
  • Científicos de Datos.
 21 Horas

Número de participantes


Precio por participante

Reseñas (6)

Próximos cursos

Categorías Relacionadas