Seguridad en bases de datos y
almacenamiento de datos masivos
[3.1] ¿Cómo estudiar este tema?
[3.2] Introducción: concepto, aplicaciones, evolución de Big Data
[3.3] Arquitectura de Big Data
[3.4] Vulnerabilidades y amenazas en Big Data
[3.5] Seguridad y privacidad en Big Data
[3.6] Referencias bibliográficas
3 TEMA
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Esquema
Seguridad
Concepto aplicaciones
Big Data
Vulnerabilidades y
am enazas
Arquitectura
Introducción
TEMA 3 – Esquema 2 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Ideas clave
3.1. ¿Cómo estudiar este tema?
Para estudiar este tema lee las Ideas clave que encontrarás a continuación, además de
los siguientes documentos:
Lizaso, N. (2015). Análisis de soluciones para la implementación de una plataforma
Big Data. Madrid: Universidad Pontificia Comillas. (páginas 1-21 y 57-90),
disponible en la siguiente dirección:
[Link]
3.2. Introducción: concepto, aplicaciones, evolución de Big Data
Para estudiar este apartado leer las páginas 1-21 del documento señalado en el
apartado ¿Cómo estudiar este tema?
El objetivo es que conozcas la tecnología Big Data, así como los entornos en los que
debe ser implementada para que su utilización sea rentable en la empresa. También se
estudiarán las principales áreas de aplicación y los problemas existentes.
3.3. Arquitectura de Big Data
Para estudiar este apartado leer las páginas 57-90 del documento señalado en el
apartado ¿Cómo estudiar este tema?
El objetivo es que conozcas la arquitectura Big Data: recolección de datos,
almacenamiento, procesamiento y análisis de datos, visualización de resultados y
seguridad. Además, se describirán las tecnologías y herramientas necesarias para ello
(hardware y software).
TEMA 3 – Material complementario 3 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
3.4. Vulnerabilidades y amenazas en Big Data
Antecedentes. Las amenazas que pueden aprovechar las vulnerabilidades de una
arquitectura Big Data caen dentro de las categorías ya estudiadas como son SANS TOP
25, OWASP TOP TEN, WASC o las amenazas más frecuentes y peligrosas en sistemas
gestores de bases de datos. El objetivo de este tema es desarrollar las peculiaridades y
aspectos específicos de la ocurrencia de amenazas aprovechando las vulnerabilidades
de una arquitectura Big Data.
El almacenamiento de los datos es un problema de seguridad importante. Las empresas
y organizaciones agregan datos de una amplia gama de repositorios y aplicaciones para
proporcionar más opciones de búsqueda con el fin de aumentar el valor de los datos.
Mediante la recopilación de datos en un almacén de datos, los usuarios van a obtener
información valiosa, pero este almacén de datos también es vulnerable a los ataques.
Una vez que el almacén de datos ha sido atacado, una enorme cantidad de datos está
expuesta e incluyen información confidencial como datos personales, cuentas
bancarias, etc. Antes de utilizar Big Data, todos los datos estaban separados en
diferentes repositorios. Debido a que se tienen que analizar grandes volúmenes de
datos hay que adicionar y guardar todos ellos en un solo almacén de datos. A pesar de
que Big Data es una tecnología única en cuanto a su función y método,
fundamentalmente, son todavía datos.
Las cuestiones de seguridad y privacidad se ven aumentadas por el
volumen, la variedad y la velocidad de Big Data. La diversidad de fuentes de
datos, formatos y flujos de datos, combinada con la naturaleza de la transmisión de
datos y el alto volumen suponen riesgos de seguridad nuevos. Este apartado:
» Aborda las implicaciones de seguridad cuando las organizaciones mueven los datos
confidenciales a un repositorio Big Data.
» Identifica los diferentes modelos de amenaza y el marco de control de seguridad
para abordar y mitigar los riesgos de seguridad debidos a las amenazas identificadas
y casos de abuso.
TEMA 3 – Material complementario 4 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Como se ha visto en apartados anteriores, el término Big Data se refiere a
cantidades masivas de información digital que las empresas recogen. Las
estimaciones de la industria sobre la tasa de crecimiento de los datos son
aproximadamente el doble cada dos años, de 2.500 exabytes en 2012 a 40.000 exabytes
en 2020. Big Data no es una tecnología específica, sino una colección de atributos y
capacidades.
Figura 1. Modelo de arquitectura Big Data. [NIST SP 1500 V4]
La investigación de Securosis añade características adicionales para un entorno
particular para calificar como Big Data:
» Maneja un petabyte de datos o más.
» Ha distribuido almacenamiento de datos redundante.
» Puede aprovechar el procesamiento de tareas paralelas.
» Puede proporcionar capacidades de procesamiento de datos.
» La inserción de datos es extremadamente rápida.
» La gestión es centralizada.
» El hardware es agnóstico.
» Es extensible: sus capacidades básicas pueden ser aumentadas y alteradas.
TEMA 3 – Material complementario 5 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
No es solo la existencia de grandes cantidades de datos lo que está creando nuevos
retos de seguridad para las organizaciones. Big Data ha sido recogida y utilizada por las
empresas durante varias décadas. Las infraestructuras de software, como Hadoop,
permiten a los desarrolladores y analistas aprovechar fácilmente cientos de nodos
informáticos para realizar la computación paralela de datos que no existía antes. Como
resultado, nuevos desafíos de seguridad han surgido del acoplamiento de Big Data con
composiciones heterogéneas de hardware de productos básicos con sistemas
operativos de productos básicos e infraestructuras de software de productos básicos
para almacenar e computar en datos.
A medida que Big Data se expande en las diferentes empresas, los mecanismos
tradicionales de seguridad diseñados para asegurar los datos estáticos a pequeña escala
y los flujos de datos en las redes de cortafuegos y semi-aisladas son inadecuados. Del
mismo modo, no está claro cómo modernizar la procedencia en la infraestructura
existente de una empresa.
Las amenazas y vulnerabilidades específicas que expone un sistema de Big Data
según son:
» Cómputo inseguro:
o Acceso a datos sensibles, programas inseguros que obtienen datos corruptos.
o Ataques de denegación de servicio DDoS. El análisis y procesamiento de grandes
cantidades de datos facilita este tipo de ataques debido al tiempo que emplean
estas tareas.
» Ausencia de validación/filtrado de entradas end-point:
o Acceso a datos sensibles mediante explotación de vulnerabilidades que
posibilitan escalada de privilegios, inyecciones de código, SQLI, XSS, etc.
» Ausencia de control de acceso granular:
o Posibilita el acceso a los datos a los usuarios de forma no autorizada.
TEMA 3 – Material complementario 6 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
» Comunicación y almacenamiento inseguro de datos:
o Los datos son distribuidos: se requiere autorización, autentificación y
encriptación en cada nodo.
o Organización automática en niveles: partición automática y movimiento de datos
de análisis en tiempo real.
o Computación continua: requiere baja latencia, rápida encriptación y
desencriptación, protección de bitácoras transaccionales.
» Violación de la privacidad de minería de datos y análisis:
o Invasión de la privacidad, marketing invasivo, revelación de información sensible
de carácter personal, financiera, etc.
En la figura 2 se observan esquemáticamente las diferencias de un entorno de Big data
con otros tipos de sistemas convencionales que emplean bases de datos relacionales
generalmente.
Dist ributed
a rchitecture
Rea l time, stream,
con tiuous
com putations
Confidentiality
A d Hoc
Qu eries
Inform ation
BIG DATA
Security In t egrity
Pa rallel and powergul
security Issue
framework Pr ogramming
La nguage
Av ailability Mov e the code
Non relational data
A uto tiering
V ariety of inputs data
Figura 2. Vulnerabilidades Big Data
TEMA 3 – Material complementario 7 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Big Data vulnerability classes
1 Insecure computation Access sensivite data, program leads to
corrupt data, Dos into big data services
2 End point input validation Trusting data, filtering data
and filtering
3 Granular Access control Prevent of end user Access data like in
relational database
4 Insecure data storage and Data is distributed: authorization,
communication authentication and excryption at each
node.
Auto tiering: auto partition and moving
data.
Real time analytics / continuous
computation: needs low latency, fast
encryption/decryption
Protection transactional Log
5 Privacy preserving data Issue of invasión privacy, invasive
mining and analytics marketing, disclose sensitive information
Figura 2. Vulnerabilidades Big Data
Como se puede apreciar en esta particularización de la figura 2, todas las categorías se
pueden enmarcar dentro de las categorías de vulnerabilidades OWASP TOP TEN 2013
y vulnerabilidades más frecuentes y peligrosas en bases de datos
3.5. Seguridad y privacidad en Big Data
La seguridad y privacidad de una arquitectura Big Data hay que abordarla como
cualquier otro tipo de sistema bajo el paraguas de un sistema de gestión de la
seguridad de la información que define una política de seguridad y a su vez
procesos como de ciclo de vida de desarrollo seguro de sistemas y
monitorización continua entre otros.
El objetivo de este tema es desarrollar las peculiaridades y aspectos específicos de la
implementación de la seguridad de una arquitectura Big Data.
TEMA 3 – Material complementario 8 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Los objetivos de este apartado son los siguientes:
» Por un lado, se especifican los puntos clave o desafíos más importantes a acometer
en lo referente a seguridad y privacidad en Big Data, desde varios puntos de vista o
estándares como el NIST o el Cloud security alliance Big Data security working
group desarrollando cada uno de los puntos clave.
» Por otro lado, otro enfoque de implementación de la seguridad de una arquitectura
Big Data que utiliza como caso de uso: Hadoop
Top 10 desafíos de seguridad y privacidad. Cloud security alliance Big Data
security working group ha compilado lo siguiente como el Top 10 de seguridad y
privacidad para implementar en Big Data:
» Cálculos seguros en entornos distribuidos de programación.
» Mejores prácticas de seguridad para datos no relacionales.
» Registro seguro de datos y de transacciones.
» Validación/filtrado de entrada de punto final.
» Monitorización de seguridad en tiempo real.
» Minería de datos y análisis.
» Cifrado de datos.
» Control de acceso granular.
» Auditorías granulares.
» Comprobación de la procedencia de los datos.
In t egrity and
In fraestructure Da ta
Da ta privacy r eactive
security m anagement
security
Sec ur e Pr i vacy preserving Sec ur e data
c omputations Data mi ning and End-poi nt
stor age and
i n di stributed anal ytics v al idation
tr ansaction
Pr ogr amming and f i ltering
l ogs
Fr amew orks
Cr y ptographically
enf or ced data Real time
Gr anular
Sec ur ity b est c entric security sec urity
audi ts
pr ac tices f or moni toring
non-r elational
data stor es
Gr anular A ccess Data
c ontr ol pr ov enance
Figura 3. Top 10 segurida Big Data
TEMA 3 – Material complementario 9 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Seguridad de Big Data: NIST Big Data working group
El NIST en su sitio web referente a Big Data y donde se publica la segunda de edición
que desarrollan diferentes aspectos de Big Data incluidos la seguridad y privacidad:
» Big Data definitions: [Link]
» Big Data taxonomies: [Link]
» Big Data use cases and requirements: [Link]
» Big Data security and privacy: [Link]
» Big Data architecture white paper survey:
[Link]
» Big Data reference architecture: [Link]
» Big Data standards roadmap: [Link]
» NIST SP 1500 v4: taxonomía conceptual de los temas de seguridad y privacidad.
La taxonomía conceptual de seguridad y privacidad para arquitecturas Big Data
presentada en la figura 2 contiene cuatro aspectos principales que desarrollaremos a
continuación y de los cuales los tres primeros temas corresponden en gran medida a
la clasificación tradicional de confidencialidad, integridad y disponibilidad (CIA),
reorientado a la computación paralelas de Big Data.
Data c onfidentiality Pr ov enance
Sec ur ity
and
pr ivacy
c onc eptual
tax onomy
Pub lic policy, soc ial and
c r oss or ganizational Sy stem health
topi cs
Figura 4. Taxonomía conceptual seguridad Big Data del NIST
TEMA 3 – Material complementario 10 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
o Confidencialidad de los datos:
- Confidencialidad de los datos en tránsito: por ejemplo, aplicada mediante el
uso de TLS (transport layer security).
- Confidencialidad de los datos almacenados: se establecerán políticas para
acceder a datos basados en credenciales.
- Computación en datos cifrados: soporte de búsqueda e informes en datos
cifrados.
- Agregación segura de datos: agregación de datos sin comprometer la
privacidad.
- Anonimato de datos: protección de la privacidad.
- Gestión de claves: seguridad de claves criptográficas en la nube.
o Procedencia de los datos:
- Validación de entrada de punto final: un mecanismo para validar si los datos
de entrada provienen de una fuente autenticada como, por ejemplo, firmas
digitales.
- Integridad de la comunicación: integridad de los datos en tránsito, aplicada,
por ejemplo, mediante el uso de TLS.
- Cálculos autenticados sobre los datos: asegurar que los cálculos que se llevan a
cabo en fragmentos críticos de datos, son ciertamente los cálculos esperados.
- Auditorías granulares: habilitación de auditoría con alta granularidad. Control
de activos valiosos.
o Rendimiento y disponibilidad del sistema:
- Disponibilidad del sistema Implementaciones de seguridad contra ataques
de denegación de servicio (DoS).
- Construcción de protocolos criptográficos (desarrollados con cifrado, firmas y
otras primitivas de comprobación de integridad criptográfica) resistentes
proactivamente a DoS.
- Inmunidad al sistema: Big Data utilizado para análisis de seguridad: análisis
de inteligencia de seguridad, detección de abuso dirigido por los datos, análisis
de Big Data en logs, eventos y agentes inteligentes, detección de eventos de
violación de la seguridad, análisis forense y apoyo de la resiliencia.
TEMA 3 – Material complementario 11 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
o Política pública, social y aspectos inter-organizaciones: el conjunto de
del tema siguiente se extrae de un grupo de ACM (association for computing
machinery). Cada uno de estos aspectos tiene dimensiones de seguridad y
privacidad de Big Data que podrían afectar la implementación de una capa
adicional en un proyecto de Big Data específico. Por ejemplo, un proyecto de
dispositivos médicos podría necesitar abordar riesgos para la seguridad humana,
mientras que un proyecto bancario se ocuparía de las diferentes regulaciones
aplicables a Big Data que cruzan las fronteras. El subgrupo anticipa trabajo para
desarrollar estos conceptos futuros de Big Data:
- Abuso y crimen relacionado con computadoras.
- Sistemas de salud públicos y privados relacionados con la informática.
- Ética (dentro de la ciencia de los datos, pero también entre las profesiones).
- Seguridad humana.
- Derechos de propiedad intelectual y gestión de la información asociada.
- Reglamento.
- Flujos de datos transfronterizos.
- Uso / abuso de poder.
Tecnologías de asistencia para personas con discapacidades (por ejemplo, seguridad
añadida o diferente, pueden ser medidas necesarias para distintos subgrupos dentro
de la población):
o Empleo (por ejemplo, las regulaciones aplicables al derecho laboral pueden regir
el uso apropiado de Big Data producidos o administrados por empleados).
o Aspectos sociales del comercio electrónico.
o Legal: censura, impuestos, cumplimiento de contratos, forenses para la aplicación
de la ley.
» NIST SP 1500 v4: taxonomía operativa de los temas de seguridad y privacidad. Las
metodologías actuales para asegurar los sistemas de Big Data son diversas,
empleando enfoques muy dispares que a menudo no forman parte de un marco
conceptual unificado. Los elementos de la taxonomía operacional mostrados en la
figura 3 representan agrupaciones de metodologías prácticas. Estos elementos se
clasifican como «operacionales» porque abordan vulnerabilidades específicas o
tareas de gestión de riesgos para el funcionamiento de los sistemas Big Data.
TEMA 3 – Material complementario 12 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
En este punto del proceso de desarrollo de estándares, estas metodologías no han
sido incorporadas como parte de una capa de seguridad. Son elementos que
componen una lista de verificación que pueden resolver necesidades específicas de
seguridad o privacidad en Big Data.
Dev i ce and
appl ication
r egi stration
Sec ur ity Identi ty and
Ri sk and
and A c c ess
ac c ountability
pr ivacy management
oper ational
tax onomy
Inf r aestruc ture Data
management gov er nanc e
Figura 5. Taxonomía operativa de seguridad Big Data del NIST
o Registro de dispositivos y aplicaciones. Registro de dispositivos, usuarios,
activos, servicios y aplicaciones Registro: incluye registro de dispositivos en redes
M2M (Machine to machicne), activos, servicios, aplicaciones y roles de usuario.
- Modelo de metadatos de seguridad.
- Aplicación de políticas: construcción del entorno, implementación de políticas,
modelo de gestión de seguridad y privacidad (taxonomía operativa de gestión
de identidades y gestión de accesos a los datos), auditoría granular de políticas
y registro del comportamiento específico de cada rol.
o Gestión de identidad y acceso:
- Gestión de identidades de la capa de virtualización.
- Gestión de identidades de la capa de aplicación.
- Gestión de identidades de la capa de usuario final.
- Proveedor de Identidad (IdP): SAML.
- Autorización de acceso a recursos: XACML, basado en políticas de atributos.
TEMA 3 – Material complementario 13 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
o Gestión de datos: sin embargo, grandes y complejos conjuntos de datos
complican la gestión de Big Data en términos de volumen de datos, velocidad,
variedad y variabilidad. Para estimular la adaptación a un cambio positivo, la
gestión de los datos necesitará persistir a lo largo del ciclo de vida de los datos (en
reposo, en movimiento, en etapas incompletas y en transacciones) mientras
proporciona seguridad y privacidad de jóvenes, ancianos, organizaciones, etc.
Se tendrán que cultivar los beneficios económicos y la innovación, pero también
permitir la libertad de acción y promover el bienestar individual y público.
Tendrá que basarse en estándares que gobiernan tecnologías y prácticas no
totalmente comprendidas al integrar el elemento humano. La gestión de Big Data
requerirá nuevas perspectivas para aceptar la lentitud o ineficacia de algunas
técnicas actuales. A continuación, se enumeran algunas consideraciones sobre la
gestión de datos:
- Aplicaciones Big Data de gestión: el desarrollo de nuevas aplicaciones que
emplean principios de Big Data y diseñadas para mejorar la gestión pueden ser
algunas de las aplicaciones de Big Data más útiles en el horizonte.
- Administración de claves de cifrado en memoria, en almacenamiento y en
tránsito.
- Aislamiento.
- Seguridad de almacenamiento.
- Prevención y detección de pérdida de datos.
- Pasarelas para servicios web.
- Transformación de datos.
- Gestión del ciclo de vida de los datos.
- Validación end-point.
- Confianza.
- Ética de la información.
TEMA 3 – Material complementario 14 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
o Gestión de la infraestructura: la gestión de la infraestructura implica
consideraciones de seguridad y privacidad relacionadas con la operación y el
mantenimiento del hardware. A continuación se enumeran algunos temas
relacionados con la gestión de infraestructuras.
- Gestión de amenazas y vulnerabilidades.
- Supervisión y alerta.
- Mitigación de eventos de seguridad.
- Gestión de la configuración.
- Logging.
- Vigilancia y remediación de malware.
- Control del perímetro de red.
- Resiliencia, redundancia y recuperación.
- Redundancia.
o Registro y gestión del riesgo: el riesgo y registro abarcan los siguientes
aspectos:
- Registro. Se pueden lograr el registro de información, procesos y roles a
través de varios medios, como portales de transparencia y puntos de
inspección, inspección de procedencia directa e inversa.
- Cumplimiento. El cumplimiento en Big Data abarca múltiples aspectos de la
taxonomía de seguridad y privacidad, reportes y leyes específicas de cada
nación.
- Análisis forense. Técnicas forenses en Big Data utilizado en escenarios de
fallas de seguridad de Big Data.
- Nivel de riesgo del negocio. En el análisis de riesgos de Big Data deben ser
asignadas a cada elemento de la taxonomía. Los modelos de riesgo empresarial
pueden y deben incorporar consideraciones de privacidad.
» Implementación de la seguridad y privacidad en Big Data: las
consideraciones de seguridad y privacidad constituyen un aspecto fundamental de la
NIST Big Data reference architecture (NBDRA) que se representan
geométricamente en la figura 5 por la capa de seguridad y privacidad que rodea los
cinco componentes principales, ya que todos los componentes se ven afectados por
consideraciones de seguridad y privacidad.
TEMA 3 – Material complementario 15 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Por lo tanto, el papel de la seguridad y la privacidad se describe correctamente en
relación con los componentes, pero no se expande en detalles más específicos que
pueden ser más precisos, pero que pueden ser mejor referenciados a una
arquitectura de referencia de seguridad y privacidad más detallada. El proveedor
de datos y el consumidor de datos están incluidos en la capa de seguridad y
privacidad, ya que, como mínimo, deben acordar los protocolos y mecanismos de
seguridad vigentes. La capa de seguridad y privacidad es una representación
aproximada que alude a la naturaleza intrínseca interconectada y ubicua de la
seguridad y la privacidad en todo el NBDRA.
Esta dimensión omnipresente se representa por la presencia de la capa de seguridad
y privacidad que rodea a todos los componentes funcionales. NIST big data group,
decidió incluir al proveedor de datos y al consumidor de datos, así como a los
proveedores de aplicaciones y marcos de trabajo de Big Data en la capa de seguridad
y privacidad porque estas entidades deben acordar los protocolos y mecanismos de
seguridad en vigor. El marco de interoperabilidad de Big Data del NIST: volumen 6,
es el documento de arquitectura de referencia que discute en detalle los otros
componentes de la NBDRA.
Figura 6. Capa de seguridad y privacidad en NBDRA
TEMA 3 – Material complementario 16 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
o Interfaz entre proveedores de datos → proveedor de aplicaciones de
Big Data. Los datos procedentes de proveedores de datos deben ser validados en
cuestiones de integridad y autenticidad. El tráfico entrante puede usarse
maliciosamente para lanzar ataques DoS o para explotar vulnerabilidades de
software. Por lo tanto, la monitorización de seguridad en tiempo real es
imprescindible. El descubrimiento y clasificación de datos debe realizarse de
manera que respete la privacidad.
o Interfaz entre los proveedores de aplicaciones de Big Data →
consumidor de datos. Los datos, incluidos los resultados agregados
entregados a los consumidores de datos, deben preservar la privacidad. Los datos
a los que acceden terceros u otras entidades deben seguir las normas legales. Las
preocupaciones incluyen el acceso a datos sensibles por parte del gobierno.
o Interfaz entre el proveedor de aplicaciones ↔ proveedor del marco
Big Data. Los datos pueden ser almacenados y recuperados bajo encriptación.
Las políticas de control de acceso deben estar en su lugar para asegurar que los
datos solo se acceden en la granularidad requerida con las credenciales
adecuadas. Las sofisticadas técnicas de cifrado pueden permitir que las
aplicaciones tengan un acceso basado en políticas a los datos, así como permitir la
búsqueda, filtrado en los datos cifrados y cálculos en el texto plano subyacente.
o Proveedor del marco interno Big Data. Los datos en reposo y los registros
de transacciones deben mantenerse seguros. La gestión de claves es esencial para
controlar el acceso y realizar un seguimiento de las claves. Las bases de datos no
relacionales deben tener una capa de medidas de seguridad. La procedencia de
datos es esencial para tener un contexto adecuado para la seguridad y la función
de los datos en cada etapa. Los ataques DoS deben ser mitigados para asegurar la
disponibilidad de los datos.
o Administradores de sistemas. Un administrador del sistema puede
desempeñar un papel crítico en la identificación, gestión, auditoría y
secuenciación de los procesos Big Data a través de los componentes. Por ejemplo,
un flujo de trabajo que traslade los datos de una etapa de recopilación a otra
preparación puede implementar aspectos de seguridad o privacidad. Los
administradores del sistema presentan una superficie de ataque adicional
atractiva para los adversarios.
TEMA 3 – Material complementario 17 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Los administradores del sistema normalmente requieren permisos elevados
permanentes o transitorios. Los administradores del sistema dan oportunidades
para implementar mecanismos de seguridad, monitorizar la procedencia, acceder
a herramientas de administración de sistemas, proporcionar puntos de auditoría
y subyugar inadvertidamente la privacidad u otras medidas de aseguramiento de
la información.
» Relación de la taxonomía operacional de la seguridad de Big Data con la
NBDRA. La tabla 1 representa una cartografía preliminar de la taxonomía
operacional a los componentes NBDRA. Los temas y actividades enumerados para
cada elemento de taxonomía operacional se han asignado a un componente NBDRA
en la columna «actividades» de la tabla 1. La columna de descripción proporciona
información adicional sobre los aspectos de seguridad y privacidad de cada
componente NBDRA.
TEMA 3 – Material complementario 18 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Tabla 1. Relación de la taxonomía operacional de la seguridad de Big Data con la NBDRA
TEMA 3 – Material complementario 19 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Caso de uso: implementación de la seguridad de un sistema para Big Data:
Hadoop
En el trabajo de Gaddam se presenta un método alternativo aunque similar al del NIST
desarrollado en el apartado anterior, para implementar la seguridad cuando las
organizaciones comienzan a mover datos confidenciales a un repositorio Big Data como
Hadoop. Proporciona los diferentes modelos de amenazas y un marco de gestión y
control de seguridad para abordar y mitigar el riesgo debido a las amenazas de
seguridad identificadas.
El trabajo describe en detalle la arquitectura del sistema Hadoop e identifica las
diferentes debilidades de seguridad de dichos sistemas y sus modelos de amenaza. Se
proporciona un marco de referencia de seguridad para un entorno empresarial
Big Data.
Los sistemas tradicionales de gestión de bases de datos relacionales han evolucionado a
lo largo de los años y con muchos «globos oculares» que evalúan su seguridad. A
diferencia de las soluciones Big Data como Hadoop que no ha tenido el mismo nivel de
rigor ni evaluación de seguridad y, por lo tanto, no puede afirmarse que la seguridad
haya sido implementada con unos requisitos aceptables.
Figura 7. Arquitectura Hadoop
TEMA 3 – Material complementario 20 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Figura 8. Arquitectura Hadoop. Funcionamiento
Hoy en día, otro gran reto a solucionar es la ausencia de normalización o
portabilidad de los controles de seguridad. Entre los diferentes proyectos de
software de código abierto (OSS) se encuentra Hadoop Big Data. La seguridad de
Hadoop está completamente fragmentada. Los principales componentes de la
propuesta Big Data security son los siguientes (similares al concepto de seguridad del
NIST):
» Gestión de datos.
» Gestión de identidad y acceso.
» Protección de datos y privacidad.
» Seguridad de la red.
» Seguridad e integridad de la infraestructura.
Los «cinco pilares» anteriores de Big Data security framework son descompuestos en
21 subcomponentes, cada uno de los cuales son fundamentales para garantizar la
seguridad y mitigar el riesgo de seguridad y los vectores de amenazas. El marco de
trabajo general de implementación de seguridad utilizado se muestra en la tabla 2.
TEMA 3 – Material complementario 21 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Tabla 2. Relación de la taxonomía operacional de la seguridad de Big Data con la NBDRA
El trabajo describe cómo implementar la seguridad en un sistema Big Data como
Hadoop, desarrollando cada apartado. Este enfoque se puede extender a cualquier otro
sistema Big Data. (consultar la referencia para más detalle).
Finalmente se dan algunas recomendaciones clave para ayudar a mitigar los riesgos de
seguridad y las amenazas identificadas en el ecosistema Big Data:
» Selecciona los productos y proveedores que tengan experiencia comprobada en
implementaciones de escala similar. Solicita referencias de proveedores para
implementaciones grandes (es decir, de tamaño similar a su organización) que han
estado ejecutando los controles de seguridad bajo consideración para su proyecto
durante al menos un año.
» Los pilares clave son: la responsabilidad, el equilibrio centrado en la red, el acceso
centrado en el control y la seguridad centrada en los datos es absolutamente esencial
para lograr una postura de seguridad globalmente confiable.
» Se prefiere la seguridad centrada en datos, como la seguridad de la etiqueta o la
seguridad a nivel de célula para los datos sensibles. La seguridad de la etiqueta y la
seguridad a nivel de célula se integran en los datos o en el código de la aplicación en
lugar de agregar seguridad de datos después del hecho.
TEMA 3 – Material complementario 22 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
» Externaliza la seguridad de los datos cuando sea posible y utiliza la redacción de
datos, el enmascaramiento de datos o la tokenización en el momento de la ingesta o
utiliza servicios de datos con controles granulares para acceder a Hadoop.
» Aprovecha el registro y la expansión de auditoría con herramientas de gestión de
datos, como OSS Apache Falcon, Cloudera Navigator o el Zettaset Orchestrator. Esto
ayuda a lograr la procedencia de los datos a largo plazo.
Herramientas disponibles para asegurar Hadoop. En se explican varias
herramientas que se pueden utilizar para asegurar Hadoop (tabla 3).
Herramienta de seguridad Características principales
Knox Gateway seguro con API REST para Hadoop con
autorización y autenticación.
Sentry Autorizacion de datos y metadatos Hadoop.
Ranger Autorización de datos y metadatos Hadoop.
Rhino Iniciativa general para mejorar la seguridad
Hadoop aportando código para toda la pila.
Tabla 3. Herramientas disponibles para implementación de seguridad en Hadoop
» Knox es un REST API Gateway para interactuar con los clústeres de Hadoop.
Proporciona un solo punto de acceso para todas las interacciones REST con clústeres
Hadoop. Además, facilita funcionalidad de control, integración, monitorización y
automatización de las necesidades críticas y analíticas de la empresa.
» Suministra funciones de autenticación, autorización y auditoría. Además:
o Se integra eficientemente con las soluciones de gestión de la empresa.
o Protege los detalles del desarrollo del clúster Hadoop.
o Simplifica el número de servicios con los que los clientes necesitan interactuar.
TEMA 3 – Material complementario 23 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Figura 9. Knox. Arquitectura
Figura 10. Knox. Arquitectura
» Sentry es otra herramienta de seguridad para Hadoop y proporciona autorización
para datos almacenados en Hadoop. Tiene un módulo de seguridad independiente
que se integra con los motores de consulta SQL de código abierto, Hive y Cloudera
Impala. Ofrece controles avanzados de autorización para permitir aplicaciones
multiusuario y procesos interfuncionales para conjuntos de datos empresariales. Se
gana control comprensivo del acceso de usuarios, se simplifica la gestión de
permisos basada en roles funcionales y se delega la gestión de seguridad.
Mientras que Hadoop tiene una gran seguridad a nivel del sistema de archivos,
Sentry introduce la granularidad necesaria para garantizar el acceso a los datos de la
mayoría de las herramientas de SQL y casos de uso.
TEMA 3 – Material complementario 24 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Los administradores de bases de datos pueden desbloquear requisitos de control y
definir lo que los usuarios y aplicaciones pueden hacer con los datos dentro de un
servidor o una base de datos.
Por otro lado, los productores de contenidos y los propietarios pueden intercalar
datos sensibles con datos no confidenciales en el mismo conjunto de información.
Además, los equipos de negocios pueden aprovechar el poder de Hadoop mientras
cumplen con mandatos regulatorios como HIPAA, SOX y PCI.
» Apache Ranger ofrece un enfoque integral de seguridad para un clúster Hadoop.
Proporciona administración de la política de seguridad central a través de los
requisitos básicos de seguridad empresarial de autorización, contabilidad y
protección de datos.
Extiende características para una aplicación coordinada a través de las cargas de
trabajo de Hadoop en batch, SQL interactivo y en tiempo real. Es, sin duda, un gran
paso adelante para el ecosistema Hadoop mediante un enfoque integral de la
seguridad, todo completamente abierto.
Ofrece un marco de seguridad centralizado para gestionar el control de acceso sobre
componentes de Hadoop de acceso a datos como Hive y HBase. Mediante la consola
de Ranger, los administradores de seguridad pueden manejar fácilmente las
políticas para el acceso a los archivos, carpetas, bases de datos, tablas o columnas.
Estas políticas se pueden configurar para usuarios individuales o grupos, y luego se
aplican dentro de Hadoop.
Los administradores de seguridad también pueden utilizarlo para gestionar la
auditoría de seguimiento y análisis de políticas para un control más exhaustivo del
medio.
TEMA 3 – Material complementario 25 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Figura 11. Ranger. Arquitectura
» El proyecto Rhino sirve a Hadoop como una solución de pila completa que
también soporta herramientas como ZooKeeper, Hive, Oozie etc. mejorando la
seguridad de todos ellos.
Algunos de los beneficios de Rhino es que añade soporte de encriptación y gestión de
claves, crea un marco común de autorización de Hadoop, inicia una única sesión,
con autenticación basada en Token y extiende el soporte de HBase para las listas de
control de acceso (ACL) hasta el nivel celular. Además, mejora el registro de
auditoría.
Básicamente, su objetivo es añadir todos los elementos de seguridad que faltan en
Hadoop. Ampliar la asistencia HBase para ACL ya se ha conseguido y con Intel que
respalda el proyecto, seguramente se mejorarán sus características.
Las principales características que aportan beneficios importantes a Hadoop son:
o Soporte para el cifrado y gestión de claves.
o Un marco común de autorización para el ecosistema Hadoop. Actualmente, cada
componente tiene su propio motor de autorización. La solución es utilizar un
marco común que contenga las funciones y una interfaz consistente. De la misma
manera, se normaliza la forma en la que las políticas de seguridad se aplican a
cada componente.
o Autenticación basada en Token e inicio de sesión único. HDFS tiene una
capacidad de delegación simple y solo Oozie puede aprovechar una parte de ella.
Con Rhino se implementa un marco de autenticación basado en Token para
desacoplar usuarios internos y se utilizan mecanismos externos para
autenticación de servicios.
TEMA 3 – Material complementario 26 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
o Aumentar el soporte de HBase para ACLs a nivel celular. Esto se consigue con la
nueva versión de HBase.
o Mejorar el registro de auditoría. La mayoría de mensajes de auditoría no utilizan
un formato unificado o consistente. Esto hace que el análisis de los registros para
verificar el cumplimiento o la adopción de medidas correctivas sea complicado.
Con Rhino esta tarea se vuelve más sencilla, con un conjunto de herramientas de
procesamiento común.
3.6. Referencias bibliográficas
EMC Big Data 2020 projects.
Lizaso, N. (2015). Análisis de soluciones para la implementación de una plataforma
Big Data. Madrid: Universidad Pontificia de Comillas. Recuperado de:
[Link]
NIST SP 1500 volume 4. Recuperado de:
[Link]
Paryasto, M., Alamsyah, A., Rahardio, B. y Kusprivanto, (2014). Big Data security
management issues. Recuperado de:
[Link]
Data_Security_Management_Issues
Securosis: securing Big Data security issues with Hadoop environments. Recuperado
de: [Link]
environments
Top 10 Big Data security and privacy challenges, cloud security Alliance. (2012).
Recuperado de:
[Link]
pdf
TEMA 3 – Material complementario 27 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Material complementario
No dejes de leer…
Análisis y desarrollo de una plataforma de Big Data
Este documento trata sobre cómo abordar la implementación de Big Data a través de
soluciones libres.
Accede al artículo desde el aula virtual o a través de la siguiente dirección web:
[Link]
Aplicaciones de Big Data en seguridad y defensa
En este documento podrás saber más sobre las aplicaciones de Big Data en seguridad y
defensa.
Accede al artículo desde el aula virtual o a través de la siguiente dirección web:
[Link]
74/[Link]
TEMA 3 – Material complementario 28 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
No dejes de ver…
Big Data: ecosistema y aplicaciones
En este documento se muestra una introducción al Big Data desde lo más básico a la
creación de índices distribuidos con los casos más típicos.
Accede al vídeo desde el aula virtual o a través de la siguiente dirección web:
[Link]
tecnologico-y-aplicaciones/549201438952/
Big Data y privacidad
Pequeña sesión sobre la privacidad en la navegación de Internet con las tecnologías de
Big Data y Fingerprinting impartida en el año 2014 durante unas jornadas en el espacio
de la Fundación Telefónica.
Accede al vídeo desde el aula virtual o a través de la siguiente dirección web:
[Link]
TEMA 3 – Material complementario 29 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
A fondo
Big Data security management issues
Principales vulnerabilidades en Big Data.
Accede al artículo desde el aula virtual o a través de la siguiente dirección web:
[Link]
Data_Security_Management_Issues
Enlaces relacionados
NIST Big Data working group
Grupo de trabajo de investigación para el desarrollo de todos los aspectos de Big Data.
Accede a la página desde el aula virtual o a través de la siguiente dirección web:
[Link]
TEMA 3 – Material complementario 30 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Cloud security Alliance
Aquí podrás ver un foro de debate que promueve el uso de buenas prácticas para
garantizar la seguridad y privacidad en el entorno del Cloud Computing.
Accede a la página desde el aula virtual o a través de la siguiente dirección web:
[Link]
Bibliografía
Buezo, L., Blanco, B. et. Al. (2015). Implicaciones de seguridad de Big Data.
Recuperado de: [Link]
[Link]
Camargo, J., y Joyanes, L. (2015). Conociendo Big Data. Recuperado de:
[Link]
Sevilla, E. y Salas, D. (2015). Diseño de una arquitectura de Big Data. Recuperado de:
[Link]
[Link]/file/view/Dise%C3%B1o+de+una+arquitectura
+para+Big+[Link]
TEMA 3 – Material complementario 31 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Actividades
Trabajo: Explotación de vulnerabilidades SQLI
Objetivos
Explotar vulnerabilidades que afectan a bases de datos, auditar su seguridad e
implementar una guía de seguridad de un SGBD MYSQL.
Tendrás que hacer la comprobación de vulnerabilidades de inyección SQL con la
aplicación WAVSEP.
Instalación: descarga la aplicación WAVSEP desde la siguiente dirección:
[Link]
Sigue las instrucciones de instalación de WAVSEV en:
[Link]
Deployment y arranca el servidor de aplicaciones Apache tomcat ejecutando el startup-
bat en el directorio /bin.
Comprueba la materialización de ataques SQLI utilizando los exploits que se
recomiendan dentro de la categoría de ataques SQLI de WAVSEP:
Evaluation of SQLI injection detection accuracy – POST- Erroneous 200 responses:
» [Link]
» [Link]
» Case05-InjectionInSearchOrderBy-String-BinaryDeliberateRuntimeError-
[Link]
Criterios de evaluación
Corrección en la ejecución de cada parte y explicación clara y concisa de lo realizado en
la memoria aportando imágenes que demuestren la implementación y comprobaciones
realizadas.
TEMA 3 – Actividades 32 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Entrega
Confecciona una memoria de 6 páginas como máximo resumiendo el resultado del
análisis de seguridad efectuado. Adjunta el fichero con el resultado del análisis.
TEMA 3 – Actividades 33 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
Test
1. El concepto de Big Data se describe con la regla de:
A. CIA: confidencialidad, integridad y autorización.
B. Las 3 V: visión, velocidad y variedad.
C. Las 3 V: volumen, velocidad y variedad.
D. Las 3 V: volumen, velocidad y visibilidad.
2. Pasos y orden en el proceso de Big Data:
A. Captura, integración, pre-proceso, control de datos, protección, análisis,
interpretación.
B. Captura, integración, pre-proceso, protección, análisis, interpretación, control
de datos.
C. Captura, integración, pre-proceso, protección, análisis, interpretación, control
de datos.
D. Captura, integración, pre-proceso, seguridad, análisis, interpretación, control
de datos.
3. Áreas de aplicación de Big Data:
A. Energía.
B. Salud.
C. Seguridad.
D. Todas las anteriores son correctas.
4. En Big Data:
A. Las bases de datos normalmente son de tipo relacional.
B. Se están utilizando más BD NOQSL.
C. El análisis de datos no necesita ser paralelo.
D. No se necesita soporte de tiempo real.
TEMA 3 – Test 34 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
5. Tipos de implementación de Big Data. Señalar la opción correcta:
A. Evolutivo: consiste en mantener la estructura actual de la empresa sumando
los datos que antes no se tenían en cuenta para pre procesarlos desde la
plataforma Big Data.
B. Revolucionario: esta implementación implica una mejor toma de decisiones, ya
que les confiere la capacidad para hacerlo, no solo en relación al volumen.
C. Híbrido: consiste en alternar el uso de las dos tecnologías en función del
objetivo perseguido.
D. Todas las anteriores son correctas.
6. Según el cloud security Alliance, el cifrado de datos se categoriza en:
A. Seguridad de datos.
B. Seguridad infraestructura.
C. Control de acceso.
D. Privacidad.
7. El NIST define una taxonomía conceptual de seguridad de Big Data y:
A. Una taxonomía operativa de seguridad de Big Data.
B. Una taxonomía de atributos de seguridad de Big Data.
C. Una taxonomía procedimental de seguridad de Big Data.
D. Ninguna de las anteriores.
8. Knox es:
A. Un gateway soap.
B. Una herramienta de cifrado.
C. Un gateway rest.
D. Ninguna de las anteriores.
9. Sentry es:
A. Una herramienta de control de acceso a recursos.
B. Una herramienta de cifrado.
C. Una herramienta de gestión de datos.
D. Un scanner de seguridad de BD,s.
TEMA 3 – Test 35 © Universidad Internacional de La Rioja (UNIR)
Seguridad en Bases de Datos y Almacenamiento de Datos Masivos
10. Ranger es:
A. Una herramienta de control de acceso a recursos.
B. Una herramienta de cifrado.
C. Una herramienta de gestión de datos.
D. Un scanner de seguridad de Bd,s.
TEMA 3 – Test 36 © Universidad Internacional de La Rioja (UNIR)