0% encontró este documento útil (0 votos)
3 vistas21 páginas

Big Data y Transformación Digital

El documento explora el papel de las tecnologías Big Data en la transformación digital, destacando la creciente generación de datos y la necesidad de adaptarse a un entorno digital. Se discuten los objetivos de la transformación digital centrados en el cliente, el uso de canales digitales y decisiones guiadas por datos. Además, se presentan tecnologías clave como Hadoop y Spark, que permiten el procesamiento distribuido de grandes volúmenes de datos no estructurados.

Cargado por

jmgarcia228
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas21 páginas

Big Data y Transformación Digital

El documento explora el papel de las tecnologías Big Data en la transformación digital, destacando la creciente generación de datos y la necesidad de adaptarse a un entorno digital. Se discuten los objetivos de la transformación digital centrados en el cliente, el uso de canales digitales y decisiones guiadas por datos. Además, se presentan tecnologías clave como Hadoop y Spark, que permiten el procesamiento distribuido de grandes volúmenes de datos no estructurados.

Cargado por

jmgarcia228
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Tecnologías Big Data

y Transformación
Digital
Dr. Pablo J. Villacorta
1 Introducción

2 Tecnologías Big Data y su papel


en la Transformación Digital

3 Procesamiento Distribuido
2 Big Data y su papel en la
Transformación Digital
BIG DATA EN TRANSFORMACIÓN DIGITAL

4
¿POR QUÉ TRANSFORMACIÓN DIGITAL?

• El 90 % de los datos actuales se generó en los últimos 2 años


• 1 Exabyte = 1 M Terabytes

Generados por
personas

Generados por máquinas


(Internet of Things,
logs, sensores…)

LOS DATOS HABLAN DE PERSONAS = CLIENTES


5
¿POR QUÉ TRANSFORMACIÓN DIGITAL?

6
EL MUNDO ESTÁ CAMBIANDO
EL MUNDO HA CAMBIADO

Compañía que mueve más personas (Coches = 0)

Compañía que reserva más habitaciones (Hoteles = 0)

Compañía que vende más música (Estudios de grabación = 0)

Compañía que vende más películas (Estudios = 0)

Hay más interacciones digitales que físicas con las compañías  Generan datos masivos

Los clientes evolucionamos más rápido que las empresas  ¿Qué quieren mis clientes?

Existe un hueco entre compañías físicas y digitales  TRANSFORMACIÓN DIGITAL


7
DIGITAL TRANSFORMATION

OBJETIVOS
1. Centrada en el cliente (customer-centric) : predecir las necesidades del cliente,
mejorar su experiencia  Analizando datos históricos de interacciones de clientes

2. Canales digitales (sobre todo móviles)  Interacciones digitales : muchísimos datos

3. Decisiones guiadas por los datos (inteligencia del dato): (Big) Data Science

Las tres V's del Big Data: Volumen, Variedad, Velocidad


- Un proyecto es Big Data cuando tiene alguna de las tres V's
- Un proyecto es Big Data cuando la mejor manera de resolverlo implica tecnologías Big
Data

8
QUÉ ES Y QUÉ NO ES BIG DATA?

• Conjunto de tecnologías y arquitecturas para almacenar, mover, acceder y procesar


(incluyendo analizar) datos que eran imposibles o muy difíciles de manejar antes
 Grandes cantidades de datos inimaginables hace años
 Fuentes diversas, heterogéneas, poco estructuradas (documentos, media)
 Datos que llegan en tiempo real y hay que analizar al vuelo (streaming)

• La definición no incluye nada como algoritmos, inteligencia, data science ni nada


relacionado con qué hacer / cómo analizar y explotar los datos. Ni fantasías como:

9
ORIGEN DE LAS TECNOLOGÍAS BIG DATA

10
ALGUNAS TECNOLOGÍAS BIG DATA

Distributed processing frameworks Distributed NoSQL datastores

Distributed File Systems

Cloud providers Distributed Storage


(infrastructure & more)

11
RECURSOS PARA APRENDER

12
3 Procesamiento Distribuido
MOTIVACIÓN DE LAS TECNOLOGÍAS BIG DATA

► Grandes cantidades de datos que una sola máquina no puede almacenar ni procesar

► Procesamiento distribuido entre varias máquinas (clúster), cada una no necesariamente muy potente
(commodity hardware)

► Si se necesita más capacidad (datos, memoria o CPU) se añaden nodos

► Datos no estructurados (imágenes, vídeo, documentos) que las BBDD relacionales no pueden manejar

► Solución: BBDD NoSQL (Hadoop ya incluye una: Apache HBase)

14 14
MOTIVACIÓN DE LAS TECNOLOGÍAS BIG DATA

Compañía Nodos
Yahoo! 42000
LinkedIn 4100
Facebook 1400
NetSeer 1050
Ebay 532
CRS4 400
Powerset / 400
Microsoft

Spotify 120 Mare Nostrum 4
Barcelona
Clusters de Hadoop en grandes empresas Supercomputing
Center (CSIC)

15 15
HISTORIA DE HADOOP Y SPARK

► Google (C++) - Almacenamiento + procesamiento usando commodity hardware


• 2003 - Google File System (GFS). [Link]

• 2004 - Map Reduce (Simplified Data Processing on Large Clusters).


[Link]

► Apache Hadoop (Java)


• 2002, Doug Cutting desarrolla Nutch. 2006, Hadoop se independiza de Nutch
• 2008, se hace open-source (incluye una implementación abierta de MapReduce)
• Adoptado en grandes empresas de todo el mundo a partir del año 2011

► Apache Spark (Scala) – Motivado por procesos iterativos (Machine Learning)


• 2009 - Matei Zaharia comenzó el proyecto en UC Berkeley's AMPLab
• 2010 - Open Source
• 2014 - Forma parte de Apache 2.0. Top Level Project
• 2015 - Más de 1000 contributors
• 2016+ La mayoría de clústeres de Hadoop son migrados a Spark.
16 16
HISTORIA DE HADOOP Y SPARK
Yahoo dona Hadoop a la
Apache Software
Foundation (ASF)

17 17
HISTORIA DE HADOOP Y SPARK

18 18
HISTORIA DE HADOOP Y SPARK

19 19
COMPONENTES PRINCIPALES DE HADOOP

► Hadoop: proyecto de software libre, con licencia Apache, cuya finalidad es prestar una plataforma para
la gestión de grandes cantidades de datos.

► HDFS: (Hadoop Distributed File System): sistema de archivos distribuido inspirado en el GFS de
Google, que permite distribuir los datos entre distintos nodos de un clúster, gestionando la distribución y
la redundancia de forma transparente para el desarrollador que vaya a hacer uso de esos datos

► MapReduce: manera de programar y también, motor de ejecución de tareas que corren de forma
distribuida en los diferentes nodos del clúster Hadoop. La forma en la que los datos se distribuyen en
diferentes subtareas y cómo estas se asignan a cada máquina resulta transparente para el
desarrollador.

► Spark: motor de ejecución en memoria de tareas que corren de forma distribuida en los diferentes
nodos del clúster. La forma en la que los datos se distribuyen en diferentes subtareas y cómo estas se
asignan a cada máquina resulta transparente para el desarrollador.

20 20
¿Preguntas?

También podría gustarte