Interactuar desde la linea de comandos con SQOOP, con la BBDD, y realizar consultas a los datos e ingesta de en HDFS.
- 馃搫 Notebook: Sqoop_Hdfs.ipynb
- SQOOP: ingesta de datos
- Sistema de ficheros HDFS: configuraci贸n del entorno.
Aplicacion de Algortimos de Machine Learning en Spark.
- 馃搫 Notebook: Machine Learning_spark.ipynb
- Carga de datos y seleccion de variables.
- Analisis descriptivo y limpieza de datos.
- An谩lisis visual.
- Regresi贸n logistica.
- Arbol de decisi贸n.
Extracci贸n de conocimiento de fuentes de datos heterog茅neas mediante Spark SQL, RDDs
- 馃搫Notebook: Dataframes_IMDB.ipynb
-
Inicializaci贸n del entorno y carga de archivos.
- 1.1 Carga de archivos en HDFS
- 1.2 Carga de los archivos en Spark y exploraci贸n
- 1.3 Particionado
-
An谩lisis de los datos
-
2.1 Consultas mediante sql
-
2.2 Analizando el dataset con Spark SQL
-
2.2.1 驴Cu谩l es el usuario que ha escrito m谩s reviews? 驴Y el que ha escrito menos (en caso de que haya m谩s de uno indica cu谩ntos hay)?
-
2.2.2 驴Cu谩l es el usuario que ha escrito m谩s reviews con spoiler?
-
2.2.3 驴Existe alguna inconsistencia entre los ratings del archivo de detalles y el archivo de reviews?
-
2.2.4 De las pel铆culas de Acci贸n, 驴cu谩l es la relaci贸n entre el n煤mero de spoilers respecto al total?
-
2.2.5 驴Cu谩l es la media de antig眉edad de las pel铆culas? 驴Y cu谩l es la diferencia (en n煤mero absoluto) media de la antig眉edad de las pel铆culas de acci贸n y las de terror (Horror)?
-
2.2.6 驴Cu谩l es el usuario que pone mejores valoraciones (media aritm茅tica)? 驴Y el que las pone peores? NOTA: Ignoraremos a los usuarios que han escrito menos de 10 reviews y si hay m谩s de uno, mu茅stralos todos.
-
2.2.7 Mostrad la media de los rating de las pel铆culas por g茅nero.
-
Contando palabras: Construye una aplicaci贸n que cuente palabras de forma eficiente.
- 馃搫Notebook: WordCount.ipynb
- Creaci贸n de un RDD y un pair RDD.
- Contar palabras usando un pair RDD.
- Encontrar las palabras individuales y su frecuencia de aparici贸n media.
- Aplicar las funcionalidades desarrolladas a un archivo de texto.
- Calcular algunos estad铆sticos.
Kafka como una fuente de datos para leer y procesar mensajes en tiempo real.
- 馃搫Notebook: Kafka.ipynb
- Creaci贸n de un topic.
- Productor / Consumidor.
- Particiones.
- Offsets.
- Adquisici贸n de datos en tiempo real.
- Apache Spark
- PySpark
- PySpark SQL
- API SparkSQL
- SQOOP
- HDFS
- RDDs
- Kafka