0% encontró este documento útil (0 votos)
35 vistas45 páginas

OLAP: Fundamentos y Modelos de Almacenamiento

Este documento describe conceptos fundamentales de inteligencia de negocios y OLAP. Explica que OLAP permite a los usuarios analizar datos complejos de manera multidimensional y resumida. También describe diferentes modelos de almacenamiento de datos OLAP como MOLAP, ROLAP y HOLAP.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
35 vistas45 páginas

OLAP: Fundamentos y Modelos de Almacenamiento

Este documento describe conceptos fundamentales de inteligencia de negocios y OLAP. Explica que OLAP permite a los usuarios analizar datos complejos de manera multidimensional y resumida. También describe diferentes modelos de almacenamiento de datos OLAP como MOLAP, ROLAP y HOLAP.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

INTELIGENCIA DE NEGOCIOS

CONCEPTOS
FUNDAMENTALES

Dr. Jonathan D. Nima Ramos


OLAP

Se pueden considerar los sistemas OLAP (On


Line Analytical Processing) [Codd et al., 1993]
como pertenecientes a los sistemas de
información para ejecutivos, EIS, utilizados para
proporcionar al nivel estratégico información
útil para la toma de decisiones.
OLAP

En un modelo de datos OLAP, la información es


vista como cubos, los cuales consisten de categorías
descriptivas (dimensiones) y valores cuantitativos
(medidas). El modelo de datos multidimensional
simplifica a los usuarios formular consultas
complejas, arreglar datos en un reporte, cambiar de
datos resumidos a datos detallados y filtrar o rebanar
los datos en subconjuntos significativos.
OLAP

Por ejemplo, las dimensiones típicas de un cubo


que contenga información de ventas incluirían:
tiempo, región, producto, canal, organización y
escenario (planeado o real). Las medidas típicas
incluirían: ventas en dólares (u otra moneda),
unidades vendidas, número de personas,
ingresos y gastos.
Visualización de los datos
mediante un cubo

Ing. Jonathan D. Nima Ramos


Visualización de los datos

La vista de los datos como un cubo es una


extensión natural de como la mayoría de los
usuarios de negocios interactúan con los datos.
Visualización de los datos

Ellos ven a un problema de negocios en


términos de un cierto número de componentes
(dimensiones) tales como productos, tiempo,
regiones, fabricantes, o artículos. Los usuarios
de negocios desean poder analizar un conjunto
de números usando cualquier par de estos
componentes, como así también poder
intercambiarlos para lograr distintas vistas.
Sin embargo, la mayoría de los usuarios también desearía ver como se desarrollan las ventas
en el tiempo. Para hacer esto, se necesitarían varias hojas de la planilla de cálculo como se
muestra en la figura
Las mismas celdas de datos se visualizan
mediante un cubo
Dado que las celdas de datos pueden ser fácilmente representadas en un cubo, se
pueden tomar rebanadas del mismo para responder preguntas como:

✓ ¿Cómo se venden los productos en cada región en un


mes dado? Esto es equivalente a ver Producto por Región
en un mes dado. Figura a).
✓ ¿Qué regiones han mejorado las ventas de un producto
dado a través del tiempo? Esto es equivalente a Región por
Tiempo de un producto dado. Figura b).
✓ ¿Cómo se venden los productos a través del tiempo en
una región dada ? Esto es equivalente a Producto por
Tiempo en una región dada. Figura c).
Figura a Figura b Figura c
Visualización de cubos

En este caso, las dimensiones son Producto, Tiempo y Región


aunque se podría agregar otra dimensión al cubo para permitir al
usuario visualizar cosas como, por ejemplo, Productos por
Cliente y responder preguntas tales como: ¿Qué cliente compró
la mayor cantidad de productos del tipo x?, pero en este caso el
cubo se vuelve más difícil de dibujar debido a que posee más de
3 dimensiones, de todas maneras el cubo funciona de la misma
forma y soporta n dimensiones, necesarias para representar a
cualquier problema del negocio de una compañía.
Visualización de cubos

Una metáfora muy usada para describir la


manera en que un cubo de datos OLAP se
puede cortar para visualizar los datos que tienen
tres o más dimensiones se denomina “slice and
dice”.
Modelos de almacenamiento

MOLAP, ROLAP y HOLAP


MOLAP

En un sistema MOLAP (OLAP multidimensional) los datos se


encuentran almacenados en una estructura multidimensional.
Para optimizar los tiempos de respuesta, el resumen de la
información es usualmente calculado por adelantado. Estos
valores precalculados o agregaciones son la base de las ganancias
de desempeño de este sistema.
Algunos sistemas utilizan técnicas de compresión de datos para
disminuir el espacio de almacenamiento en disco debido a los
valores precalculados.
ROLAP

ROLAP (OLAP Relacional) es un sistema en el


cual los datos se encuentran almacenados en
una base de datos relacional. Típicamente, los
datos son detallados, evitando las agregaciones y
las tablas se encuentran normalizadas. Los
esquemas más comunes sobre los que se trabaja
son estrella o copo de nieve, aunque es posible
trabajar sobre cualquier base de datos relacional.
HOLAP

Un sistema HOLAP (OLAP Híbrido) mantiene los


registros detallados en la base de datos relacional,
mientras que los datos resumidos o agregados se
almacenan en una base de datos multidimensional
separada. Este método de almacenamiento es una
combinación de los dos anteriores e intenta rescatar
lo mejor de cada uno.
Comparaciones
Comparaciones

El primer enfoque corresponde a MOLAP. Con este método,


los datos son precalculados y luego son almacenados en cubos
de datos multidimensionales.
El resultado se traduce en una mejor performance en los
tiempos de respuesta debido a que los datos se encuentran
disponibles sin necesidad de calcularlos en cada nueva consulta.
La desventaja de este enfoque se debe a que almacenar datos
multidimencionalmente ocupa mucho más espacio que con
ROLAP.
Comparaciones

El segundo enfoque es ROLAP donde los datos


son accedidos directamente del Data Warehouse
(u otro tipo de fuente relacional) y no son
almacenados por separado. Estos datos se
calculan en tiempo de consulta (al vuelo). Por lo
tanto el tiempo de respuesta sería mayor pero
sin usar enormes cantidades de almacenamiento
en disco.
Comparaciones

Las implementaciones MOLAP normalmente se


desempeñan mejor que la tecnología ROLAP,
pero tienen problemas de escalabilidad.
Las implementaciones ROLAP son más
escalables y son frecuentemente atractivas a los
clientes debido a que aprovechan las inversiones
en tecnologías de bases de datos relacionales
preexistentes
Comparaciones

La mejor solución probablemente esté entre los


dos extremos.
En muchos casos se utilizan HOLAP que
resultan de una combinación entre ROLAP y
MOLAP. HOLAP mantiene los volúmenes de
datos más grandes en la base de datos relacional
y las agregaciones en una base de datos MOLAP
separada, logrando con esto un balance entre
tiempo y espacio.
Data Mining
Data Mining

En una mina se desechan enormes cantidades


de material inservible antes de que oro o
diamantes sean encontrados.
Data Mining

El término Data Mining es una metáfora que


surge como analogía de lo anterior, y afirma
que con una computadora se puede encontrar
de manera automática un “diamante de
información” entre toneladas de datos
inservibles en una base de datos, teniendo en
cuenta que la información es un recurso muy
valioso para una compañía tanto como lo es
un diamante para un minero
Data Mining

Data Mining se ocupa del descubrimiento de


conocimiento oculto, patrones inesperados y
nuevas reglas a partir de grandes volúmenes de
datos. Actualmente se considera a Data Mining
el elemento clave de un proceso mucho más
elaborado llamado KDD, el cual está
estrechamente ligado a otro importante
desarrollo tecnológico, el Data Warehousing.
Proceso KDD
KDD

Si bien los términos Minería de Datos (Data


Mining) y Descubrimiento de Conocimiento en
Bases de Datos (Knowledge Discovery in
Databases o KDD) son usados como sinónimos
por algunos autores, el término KDD describe
el proceso completo de extracción de
conocimiento a partir de los datos.
KDD

Mientras que Data Mining se refiere


exclusivamente a la fase de descubrimiento del
proceso completo KDD. Esta confusión se
debe a que Data Mining era el término que se
usaba anteriormente para describir el proceso
entero de KDD.
Definición de KDD

“...la extracción no trivial de conocimiento


previamente desconocido y potencialmente útil
a partir de un gran volumen de datos en el cual
la información está implícita”. [Fayyad, 1996b].
Selección de los datos

En este paso se seleccionan los datos necesarios


para el análisis. En la mayoría de los casos, estos
datos se encuentran almacenados en bases de
datos operacionales usadas por los sistemas de
información de la organización.
Limpieza
Una tarea importante en la operación de limpieza es
la de eliminar registros duplicados (de-duplicación),
por ejemplo un cliente puede aparecer cargado 2
veces como consecuencia de un error de ortografía
al cargar su apellido.
Otro problema es la falta de consistencia de los
dominios, por ejemplo una transacción listada en
una tabla finalizada en 1901 pero la compañía se
estableció después de 1901.
Mejora

Agregar nueva información (datos


externos) y combinarla con los
registros existentes.
Codificación

Algunas veces la información contenida en la


base de datos no tiene el formato requerido por
los algoritmos de reconocimiento de patrones.
Algunos ejemplos de codificaciones incluyen
pasar de dirección a región, fecha de nacimiento
a edad, dividir ingresos por 1000, etc.
Data Mining

Aquí es donde realmente aparece la fase de


descubrimiento de conocimiento oculto y para
ello existen diferentes técnicas que se usan para
diferentes propósitos.
Técnicas de Data Mining

Procesamiento analítico en línea (OLAP)


Reglas de asociación
Arboles de decisión
Clustering
Reportes

Los resultados de la aplicación de Data Mining


se pueden mostrar en diferentes formatos. En
general, se pueden usar reportes o gráficos para
visualizar los resultados.
Diferentes formas de
conocimiento

Ing. Jonathan D. Nima Ramos


Conocimiento evidente

Esta es la información que se puede recuperar


fácilmente de bases de datos usando
herramientas de consulta tales como SQL.
Conocimiento
multidimensional

Esta es la información que se puede analizar


utilizando herramientas de procesamiento
analítico en línea OLAP. La mayoría de las cosas
que se pueden hacer con OLAP también
pueden hacerse utilizando SQL. La ventaja de
OLAP es que está optimizada para este tipo de
búsqueda y operaciones de análisis.
Conocimiento oculto

Estos datos se pueden encontrar fácilmente


con KDD y en particular con algoritmos de
Data Mining. Una vez más, se podría utilizar
SQL para encontrar estos patrones pero se
consumiría una enorme cantidad de tiempo.
Es decir, utilizando algoritmos de Data
Mining se pueden encontrar datos ocultos en
minutos, mientras que utilizando SQL se
tardarían meses para conseguir los mismos
resultados.
Conocimiento profundo

Esta es la información que está almacenada en la


base de datos pero sólo puede ser localizada si
se tienen pistas que indiquen donde buscar.

También podría gustarte