Instructor:
Erick Luna Rojas
Agenda ► Hadoop
► Desafíos y Soluciones de Big Data
► Fuentes de Big Data ► Hadoop en Docker
► Ecosistema de Hadoop para Big Data ► CDH en Docker
► Revisar un Cluster CDH en la Nube
► Workshop Hadoop
Hadoop
► Tecnología Big Data: Apache Hadoop
► Hadoop es un proyecto de código abierto
(open source), supervisado por la
Apache
Software Foundation.
► Originalmente basado en documentos
publicados por Google en 2003 y 2004
► Hadoop es un ecosistema, no sólo un
producto.
► Apache Hadoop es una colección de
software
de código abierto que permite el
almacenamiento distribuido y el procesamiento
de grandes conjuntos de datos en un grupo de
diferentes tipos de sistemas informáticos.
► Fue creado por Doug Coutting mientras trabajaba
en Yahoo.
► El logo y nombre de "Hadoop" fue inspirado en uno
de los juguetes de hijo de Doug Cotting.
Fuente: Castro, Eduardo.2015. "SQL Pass Bogota 2015". Microsoft Big Data Stack. Recuperado de [Link]
Hadoop
[Link]
Hadoop
Referencia: [Link]
[Link]
[Link]
[Link]
Hadoop
► Es un sistema de código abierto que se utiliza
para almacenar, procesar, y analizar grandes
volúmenes de datos.
► Aíslaa los desarrolladores de todas las dificultades
presentes en la programación paralela.
► Cuenta con un ecosistema que sirve de gran
ayuda al usuario, ya que permite distribuir el
fichero en nodos, que no son otra cosa que
ordenadores con commodity-hardware.
► Escapaz de ejecutar procesos en paralelo en todo
momento.
► Dispone de módulos de control para la
monitorización de los datos.
► Presenta una opción que permite realizar
consultas.
► También potencia la aparición de distintos add
ons, que facilitan el trabajo, manipulación y
seguimiento de toda la información que en él se
almacena.
► Ventajas
Fuente: PowerData, 2013. “¿Cómo se relacionan Big Data y Hadoop?” . Recuperado de
[Link] relacionan-big-data-y-hadoop
Hadoop
Hadoop
Hadoop
MapReduce: Motor de
procesamiento de aplicaciones en Hadoop.
YARN: Administrador de recursos del clúster (CPU,
Memoria, Disco, entre otros recursos)
HDFS: Sistema de archivos para el almacenamiento
de datos.
Hadoop
HADOOP 1 HADOOP 2
Namenode Namenode
Datanode Datanode
Secondary
Namenode
Job Tracker Task
Tracker
Secondary Namenode
Resource Manager
Application Manager
Node
Manager
Application Master
Container
Preguntas y Consultas
Herramientas de trabajo
► Herramienta de virtualización
► Oracle VirtualBox 5.1 o superior
► Tenemos maquinas virtuales, con
sistema operativo preinstalado
► Ubuntu
► CentOS
Herramientas de trabajo
► Herramienta de virtualización
► Oracle VirtualBox 5.1 o superior
► Tenemos maquinas virtuales, con
sistema operativo preinstalado
► Ubuntu
► CentOS
Workshop Tools
Preguntas y Consultas
Desafíos y Soluciones de Big Data
► Desafío #1: Almacenar grandes cantidades de datos.
► Ninguna máquina de almacenamiento es lo
suficientemente grande como para almacenar la
cantidad de datos que crece incesantemente. Se
necesita almacenar en una gran cantidad de
máquinas más pequeñas y económicas.
► Existe el desafío inevitable de la falla de la máquina.
La
falla de una máquina podría implicar una pérdida
de
datos almacenados en ella.
► Solución:
Distribuir datos a través de un gran grupo
escalable de máquinas de bajo costo.
► Garantiza que cada dato se repita
sistemáticamente en
varias máquinas para
► garantizar que siempre haya al menos una copia
disponible.
► Agregar más máquinas según sea necesario.
► Hadoop es un sistema bien conocido para gestionar
grandes volúmenes.
Desafíos y Soluciones de Big Data
► Desafío #2: Ingestión y procesamiento de
flujos
a un ritmo extremadamente rápido.
► Flujos
de datos impredecibles y torrenciales
demasiado grandes para almacenar, pero
aún
deben ser monitoreados.
► Solución:Crear sistemas de ingesta
escalables.
► Puede abrir un número ilimitado de canales
para
recibir datos. Los datos se pueden guardar
en
colas, desde las cuales las aplicaciones
comerciales pueden leer y procesar datos a su
propio ritmo y conveniencia. Apache Kafka es un
sistema popular de ingesta dedicado.
► Elmotor de procesamiento de flujo puede hacer
su trabajo mientras el procesamiento por lotes
hace su trabajo. Apache Spark es el sistema más
popular para aplicaciones de transmisión.
Desafíos y Soluciones de Big Data
► Desafío#3: Manejar una variedad de formas y
funciones de datos.
► Almacenarlos en estructuras planas o
relacionales tradicionales sería demasiado poco
práctico, antieconómico y lento. Acceder y
analizarlos requiere diferentes
capacidades.
► Solución: Use sistemas no relacionales
que
relajen muchas de las condiciones más
estrictas del modelo relacional.
► Estas se llaman bases de datos NoSQL (no
solo
SQL). Estas bases de datos están
optimizadas
para ciertas tareas, como
procesamiento de
consultas o procesamiento de gráficos,
procesamiento de documentos, etc.
► HBase y Cassandra son dos de los sistemas de
bases de datos NoSQL más conocidos.
Desafíos y Soluciones de Big Data
► Desafío#4: Procesamiento de grandes cantidades
de datos.
► Mover grandes cantidades de datos
desde el
almacenamiento al procesador
consumiría una
enorme capacidad de red y ahogaría la
red.
► Solución:
Mueva el procesamiento al
lugar donde
se almacenan los datos.
► Distribuyala lógica de la tarea en
todoel conjunto de máquinas donde
se
almacenan los datos.
► Las máquinas trabajan en paralelo en los datos que
se les asignan.
► Un proceso de seguimiento consolidalos
resultados intermedios y entrega los
resultados finales.
► MapReduce, inventado por Google, es la
tecnología más conocidaparael
procesamiento paralelo.
Desafíos y Soluciones de Big Data
Fuentes de Big Data
► Big Data incluye todos los datos, sobre todas
las actividades, en todas partes.
► Por tanto, puede transformar potencialmente
nuestra perspectiva sobre la vida y el
universo. Puede aportar nuevos
conocimientos en tiempo real, hacer la vida
más feliz y hacer que el mundo sea más
productivo.
► Sin embargo, Big Data también puede traer
peligros, en términos de violación de la
privacidad y trastornos sociales y
económicos.
► Tres (03) categorías de fuentes de Big Data.
Fuentes de Big Data
► Comunicación entre Personas
► Redes Sociales.
► Medios viejos y nuevos;
► One-to-one (1-1) y redes sociales.
► Plataformas de escucha para filtrar y analizar.
► Video, audio, más variedad.
Fuentes de Big Data
► Comunicación entre Personas y Máquinas
► Acceso y Registros Web.
► Asistentes digitales.
► Registros de movimiento de teléfonos móviles.
► Dispositivos de ejercicios personales móviles.
Fuentes de Big Data
► Comunicación Máquina a Máquina (M2M)
► Sensores y rastreadores.
► Dispositivos RFID.
► Internet de las cosas (IoT): Un trillón de
dispositivos.
► Plataformas de escucha para filtrar y analizar.
Aplicaciones de Big Data
Aplicaciones de monitoreo y ► Seguimiento de la cadena de suministro.
seguimiento. ► Seguimiento del consumo eléctrico. ►
► Vigilancia de la salud pública. Mantenimiento preventivo de máquinas.
► Monitoreo del sentimiento del Aplicaciones de análisis e
consumidor. ► Seguimiento de activos. información.
► Vigilancia predictiva.
personal.
► Ganar elecciones políticas. ► Salud
Preguntas y Consultas
Ecosistema de Hadoop para Big Data
► [Link]
p-ecosystem-components/
► [Link]
g/2020/10/introduction-hadoop
ecosystem/
Los mecanismos representan artefactos tecnológicos que se pueden combinar para crear
arquitecturas tecnológicas de Big Data.
Los mecanismos representan artefactos tecnológicos que se pueden combinar para crear
arquitecturas tecnológicas de Big Data.
Ecosistema de Hadoop para Big
Data
Fuente:
[Link]
Ecosistema de Hadoop para Big Data
Fuente:
[Link]
Preguntas y Consultas