Big Data
Hace referencia al manejo y análisis de grandes volúmenes de datos, que pueden ser tanto
estructurados como no estructurados, con el objetivo de obtener conocimientos valiosos y
apoyar la toma de decisiones.
3.0Componentes
1. Fuentes de datos:
Datos estructurados (bases de datos relacionales, hojas de cálculo).
Datos no estructurados (imágenes, videos, audio, textos, redes sociales).
Datos semiestructurados (JSON, XML, logs de servidores).
2. infraestructura de almacenamiento:
HDFS (Hadoop Distributed File System): Almacenamiento distribuido.
Bases de datos NoSQL: Como MongoDB, Cassandra y HBase.
Data Lakes: Repositorios masivos de datos crudos.
3. Procesamiento y análisis de datos:
Batch Processing: Procesamiento por lotes (Hadoop, Spark).
Stream Processing: Procesamiento en tiempo real (Kafka, Flink).
4. Plataformas y herramientas:
Hadoop: Marco de trabajo de procesamiento distribuido.
Apache Spark: Procesamiento en memoria para análisis rápido.
ElasticSearch:Búsqueda y análisis de datos en tiempo real.
Tableau, Power BI: Herramientas para visualización de datos.
5. Seguridad y gestión de datos:
Encriptación y gestión de accesos (Data Governance).
Anonimización y cumplimiento de normativas (GDPR, CCPA)
Características del Big Data
1. Las 5 V’s del Big Data:
Volumen: La cantidad masiva de datos generados diariamente.
Velocidad: La rapidez con la que se generan y deben ser procesados los datos en tiempo real.
Variedad: Diversidad de tipos de datos (texto, imágenes, audio, etc.).
Veracidad: La calidad y confiabilidad de los datos, ya que pueden ser ruidosos o
inconsistentes.
Valor: La capacidad de extraer información útil para generar decisiones y ventajas
competitivas.
2. Escalabilidad:
La infraestructura debe crecer para manejar cantidades mayores de datos sin perder
eficiencia.
3. Alta disponibilidad:
Asegura que los sistemas estén operativos y accesibles en todo momento.
4. Procesamiento distribuido:
El análisis y almacenamiento se realizan en múltiples nodos para aumentar la eficiencia.
5. Automatización y aprendizaje automático:
Big Data impulsa sistemas inteligentes mediante el uso de Machine Learning e Inteligencia
Artificial (IA).
6. Integración de datos heterogéneos:
La capacidad de combinar fuentes de datos diversas para obtener una visión más completa.
El Big Data tiene aplicaciones en muchos campos, como el marketing digital, la salud, las
finanzas y la logística, permitiendo el análisis predictivo, la personalización de servicios, y la
optimización de procesos empresariales.
[Link]ías y Herramientas en Big Data
1. Almacenamiento de Datos
HDFS, Amazon S3, Data Lakes: Repositorios masivos de datos.
NoSQL (MongoDB, Cassandra, HBase): Bases de datos para datos no estructurados.
2. Procesamiento y Análisis
Batch Processing: Hadoop, Spark (procesamiento masivo).
Stream Processing: Kafka, Flink, Storm (análisis en tiempo real).
[Link] de Datos y Gestión
Relacionales: MySQL, PostgreSQL.
En memoria:Redis, ElasticSearch.
Data Warehouses: Redshift, BigQuery, Snowflake.
[Link]ón de Datos
Tableau, Power BI, Google Data Studio: Dashboards interactivos.
5. Machine Learning e IA
TensorFlow, PyTorch: Modelos predictivos e IA.
MLlib (Spark), [Link]: Aprendizaje automático en Big Data.
6. ETL e Integración de Datos
Talend, Apache Nifi, AWS Glue: Flujos ETL automáticos.
[Link] y Gobernanza
Apache Ranger, Atlas: Gestión de acceso y linaje.
Databricks, Collibra: Control y calidad de datos.
8. Big Data en la Nube
AWS, Azure, Google Cloud: Almacenamiento y análisis escalable.
4.1Bases de datos NoSQL
Las bases de datos NoSQL son ideales para manejar grandes volúmenes de datos no
estructurados o semiestructurados, ofreciendo alta escalabilidad y rendimiento.
Tipos Principales
1. Orientadas a Documentos:
o Ej.: MongoDB, CouchDB (almacenan datos en JSON/BSON).
2. Claves-Valor:
o Ej.: Redis, DynamoDB (usadas para cachés y sesiones).
3. Columnas Distribuidas:
o Ej.: Cassandra, HBase (optimizadas para grandes volúmenes).
4. Grafos:
o Ej.: Neo4j, Amazon Neptune (modelan relaciones complejas).
Características
Escalabilidad Horizontal: Se añaden nodos para mejorar rendimiento.
Alto Rendimiento: Consultas rápidas con grandes volúmenes.
Flexibilidad de Esquema: No requieren estructura rígida.
Alta Disponibilidad: Replicación y distribución de datos.
4.2Herramientas de procesos de Datos
Procesos
1. Ingesta: Captura de datos (ETL, streaming).
2. Almacenamiento: Bases de datos NoSQL, Data Lakes.
3. Procesamiento:
o Batch: Hadoop, Spark.
o Tiempo real: Kafka, Flink.
4. Análisis: Machine Learning, IA.
5. Visualización: Dashboards con Tableau, Power BI.
Herramientas
ETL: Talend, AWS Glue.
Bases de datos: MongoDB, Cassandra.
Streaming: Apache Kafka, Flink.
Machine Learning: TensorFlow, Spark MLlib
4.3Almacenamiento y Computación en la nube
Almacenamiento
Amazon S3, Azure Data Lake, Google Cloud Storage: Guardan grandes volúmenes de datos
estructurados y no estructurados.
Data Warehouses: (Redshift, BigQuery, Snowflake) Para consultas y análisis rápidos.
Data Lakes: Almacenan datos crudos para análisis flexible y masivo.
Computación
AWS EMR, Azure HDInsight, Google Dataproc: Plataformas para procesamiento distribuido de
grandes datos (batch y streaming).
Escalabilidad:Permiten añadir recursos bajo demanda según el volumen de datos y las
necesidades de procesamiento.