Tecnologías Big Data
y Transformación
Digital
Dr. Pablo J. Villacorta
1 Introducción
2 Tecnologías Big Data y su papel
en la Transformación Digital
3 Procesamiento Distribuido
2 Big Data y su papel en la
Transformación Digital
BIG DATA EN TRANSFORMACIÓN DIGITAL
4
¿POR QUÉ TRANSFORMACIÓN DIGITAL?
• El 90 % de los datos actuales se generó en los últimos 2 años
• 1 Exabyte = 1 M Terabytes
Generados por
personas
Generados por máquinas
(Internet of Things,
logs, sensores…)
LOS DATOS HABLAN DE PERSONAS = CLIENTES
5
¿POR QUÉ TRANSFORMACIÓN DIGITAL?
6
EL MUNDO ESTÁ CAMBIANDO
EL MUNDO HA CAMBIADO
Compañía que mueve más personas (Coches = 0)
Compañía que reserva más habitaciones (Hoteles = 0)
Compañía que vende más música (Estudios de grabación = 0)
Compañía que vende más películas (Estudios = 0)
Hay más interacciones digitales que físicas con las compañías Generan datos masivos
Los clientes evolucionamos más rápido que las empresas ¿Qué quieren mis clientes?
Existe un hueco entre compañías físicas y digitales TRANSFORMACIÓN DIGITAL
7
DIGITAL TRANSFORMATION
OBJETIVOS
1. Centrada en el cliente (customer-centric) : predecir las necesidades del cliente,
mejorar su experiencia Analizando datos históricos de interacciones de clientes
2. Canales digitales (sobre todo móviles) Interacciones digitales : muchísimos datos
3. Decisiones guiadas por los datos (inteligencia del dato): (Big) Data Science
Las tres V's del Big Data: Volumen, Variedad, Velocidad
- Un proyecto es Big Data cuando tiene alguna de las tres V's
- Un proyecto es Big Data cuando la mejor manera de resolverlo implica tecnologías Big
Data
8
QUÉ ES Y QUÉ NO ES BIG DATA?
• Conjunto de tecnologías y arquitecturas para almacenar, mover, acceder y procesar
(incluyendo analizar) datos que eran imposibles o muy difíciles de manejar antes
Grandes cantidades de datos inimaginables hace años
Fuentes diversas, heterogéneas, poco estructuradas (documentos, media)
Datos que llegan en tiempo real y hay que analizar al vuelo (streaming)
• La definición no incluye nada como algoritmos, inteligencia, data science ni nada
relacionado con qué hacer / cómo analizar y explotar los datos. Ni fantasías como:
9
ORIGEN DE LAS TECNOLOGÍAS BIG DATA
10
ALGUNAS TECNOLOGÍAS BIG DATA
Distributed processing frameworks Distributed NoSQL datastores
Distributed File Systems
Cloud providers Distributed Storage
(infrastructure & more)
11
RECURSOS PARA APRENDER
12
3 Procesamiento Distribuido
MOTIVACIÓN DE LAS TECNOLOGÍAS BIG DATA
► Grandes cantidades de datos que una sola máquina no puede almacenar ni procesar
► Procesamiento distribuido entre varias máquinas (clúster), cada una no necesariamente muy potente
(commodity hardware)
► Si se necesita más capacidad (datos, memoria o CPU) se añaden nodos
► Datos no estructurados (imágenes, vídeo, documentos) que las BBDD relacionales no pueden manejar
► Solución: BBDD NoSQL (Hadoop ya incluye una: Apache HBase)
14 14
MOTIVACIÓN DE LAS TECNOLOGÍAS BIG DATA
Compañía Nodos
Yahoo! 42000
LinkedIn 4100
Facebook 1400
NetSeer 1050
Ebay 532
CRS4 400
Powerset / 400
Microsoft
…
Spotify 120 Mare Nostrum 4
Barcelona
Clusters de Hadoop en grandes empresas Supercomputing
Center (CSIC)
15 15
HISTORIA DE HADOOP Y SPARK
► Google (C++) - Almacenamiento + procesamiento usando commodity hardware
• 2003 - Google File System (GFS). [Link]
• 2004 - Map Reduce (Simplified Data Processing on Large Clusters).
[Link]
► Apache Hadoop (Java)
• 2002, Doug Cutting desarrolla Nutch. 2006, Hadoop se independiza de Nutch
• 2008, se hace open-source (incluye una implementación abierta de MapReduce)
• Adoptado en grandes empresas de todo el mundo a partir del año 2011
► Apache Spark (Scala) – Motivado por procesos iterativos (Machine Learning)
• 2009 - Matei Zaharia comenzó el proyecto en UC Berkeley's AMPLab
• 2010 - Open Source
• 2014 - Forma parte de Apache 2.0. Top Level Project
• 2015 - Más de 1000 contributors
• 2016+ La mayoría de clústeres de Hadoop son migrados a Spark.
16 16
HISTORIA DE HADOOP Y SPARK
Yahoo dona Hadoop a la
Apache Software
Foundation (ASF)
17 17
HISTORIA DE HADOOP Y SPARK
18 18
HISTORIA DE HADOOP Y SPARK
19 19
COMPONENTES PRINCIPALES DE HADOOP
► Hadoop: proyecto de software libre, con licencia Apache, cuya finalidad es prestar una plataforma para
la gestión de grandes cantidades de datos.
► HDFS: (Hadoop Distributed File System): sistema de archivos distribuido inspirado en el GFS de
Google, que permite distribuir los datos entre distintos nodos de un clúster, gestionando la distribución y
la redundancia de forma transparente para el desarrollador que vaya a hacer uso de esos datos
► MapReduce: manera de programar y también, motor de ejecución de tareas que corren de forma
distribuida en los diferentes nodos del clúster Hadoop. La forma en la que los datos se distribuyen en
diferentes subtareas y cómo estas se asignan a cada máquina resulta transparente para el
desarrollador.
► Spark: motor de ejecución en memoria de tareas que corren de forma distribuida en los diferentes
nodos del clúster. La forma en la que los datos se distribuyen en diferentes subtareas y cómo estas se
asignan a cada máquina resulta transparente para el desarrollador.
20 20
¿Preguntas?