Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

History

4 Commits

Repository files navigation

Apache Spark Apache Hadoop Apache Kafka

Actividades - Big Data

Actividad 1:

Interactuar desde la linea de comandos con SQOOP, con la BBDD, y realizar consultas a los datos e ingesta de en HDFS.

  • 馃搫 Notebook: Sqoop_Hdfs.ipynb
  1. SQOOP: ingesta de datos
  2. Sistema de ficheros HDFS: configuraci贸n del entorno.

Actividad 2:

Aplicacion de Algortimos de Machine Learning en Spark.

  • 馃搫 Notebook: Machine Learning_spark.ipynb
  1. Carga de datos y seleccion de variables.
  2. Analisis descriptivo y limpieza de datos.
  3. An谩lisis visual.
  4. Regresi贸n logistica.
  5. Arbol de decisi贸n.

Actividad 3:

Extracci贸n de conocimiento de fuentes de datos heterog茅neas mediante Spark SQL, RDDs

  • 馃搫Notebook: Dataframes_IMDB.ipynb
  1. Inicializaci贸n del entorno y carga de archivos.

    • 1.1 Carga de archivos en HDFS
    • 1.2 Carga de los archivos en Spark y exploraci贸n
    • 1.3 Particionado
  2. An谩lisis de los datos

    • 2.1 Consultas mediante sql

    • 2.2 Analizando el dataset con Spark SQL

    • 2.2.1 驴Cu谩l es el usuario que ha escrito m谩s reviews? 驴Y el que ha escrito menos (en caso de que haya m谩s de uno indica cu谩ntos hay)?

    • 2.2.2 驴Cu谩l es el usuario que ha escrito m谩s reviews con spoiler?

    • 2.2.3 驴Existe alguna inconsistencia entre los ratings del archivo de detalles y el archivo de reviews?

    • 2.2.4 De las pel铆culas de Acci贸n, 驴cu谩l es la relaci贸n entre el n煤mero de spoilers respecto al total?

    • 2.2.5 驴Cu谩l es la media de antig眉edad de las pel铆culas? 驴Y cu谩l es la diferencia (en n煤mero absoluto) media de la antig眉edad de las pel铆culas de acci贸n y las de terror (Horror)?

    • 2.2.6 驴Cu谩l es el usuario que pone mejores valoraciones (media aritm茅tica)? 驴Y el que las pone peores? NOTA: Ignoraremos a los usuarios que han escrito menos de 10 reviews y si hay m谩s de uno, mu茅stralos todos.

    • 2.2.7 Mostrad la media de los rating de las pel铆culas por g茅nero.

Actividad 4:

Contando palabras: Construye una aplicaci贸n que cuente palabras de forma eficiente.

  • 馃搫Notebook: WordCount.ipynb
  1. Creaci贸n de un RDD y un pair RDD.
  2. Contar palabras usando un pair RDD.
  3. Encontrar las palabras individuales y su frecuencia de aparici贸n media.
  4. Aplicar las funcionalidades desarrolladas a un archivo de texto.
  5. Calcular algunos estad铆sticos.

Actividad 5:

Kafka como una fuente de datos para leer y procesar mensajes en tiempo real.

  • 馃搫Notebook: Kafka.ipynb
  1. Creaci贸n de un topic.
  2. Productor / Consumidor.
  3. Particiones.
  4. Offsets.
  5. Adquisici贸n de datos en tiempo real.

Tech Stack

  • Apache Spark
  • PySpark
  • PySpark SQL
  • API SparkSQL
  • SQOOP
  • HDFS
  • RDDs
  • Kafka

About

馃搱馃搳 Big Data Notebooks . 鈻笍 An谩lisis masivos de datos con pyspark 鈻笍 Ingesta de datos. 鈻笍 Algoritmos de machine learning con datos masivos. 鈻笍 Procesamiento de mensajes en tiempo real con Kafka.

Topics

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages