INTELIGENCIA DE NEGOCIOS
CONCEPTOS
FUNDAMENTALES
Dr. Jonathan D. Nima Ramos
OLAP
Se pueden considerar los sistemas OLAP (On
Line Analytical Processing) [Codd et al., 1993]
como pertenecientes a los sistemas de
información para ejecutivos, EIS, utilizados para
proporcionar al nivel estratégico información
útil para la toma de decisiones.
OLAP
En un modelo de datos OLAP, la información es
vista como cubos, los cuales consisten de categorías
descriptivas (dimensiones) y valores cuantitativos
(medidas). El modelo de datos multidimensional
simplifica a los usuarios formular consultas
complejas, arreglar datos en un reporte, cambiar de
datos resumidos a datos detallados y filtrar o rebanar
los datos en subconjuntos significativos.
OLAP
Por ejemplo, las dimensiones típicas de un cubo
que contenga información de ventas incluirían:
tiempo, región, producto, canal, organización y
escenario (planeado o real). Las medidas típicas
incluirían: ventas en dólares (u otra moneda),
unidades vendidas, número de personas,
ingresos y gastos.
Visualización de los datos
mediante un cubo
Ing. Jonathan D. Nima Ramos
Visualización de los datos
La vista de los datos como un cubo es una
extensión natural de como la mayoría de los
usuarios de negocios interactúan con los datos.
Visualización de los datos
Ellos ven a un problema de negocios en
términos de un cierto número de componentes
(dimensiones) tales como productos, tiempo,
regiones, fabricantes, o artículos. Los usuarios
de negocios desean poder analizar un conjunto
de números usando cualquier par de estos
componentes, como así también poder
intercambiarlos para lograr distintas vistas.
Sin embargo, la mayoría de los usuarios también desearía ver como se desarrollan las ventas
en el tiempo. Para hacer esto, se necesitarían varias hojas de la planilla de cálculo como se
muestra en la figura
Las mismas celdas de datos se visualizan
mediante un cubo
Dado que las celdas de datos pueden ser fácilmente representadas en un cubo, se
pueden tomar rebanadas del mismo para responder preguntas como:
✓ ¿Cómo se venden los productos en cada región en un
mes dado? Esto es equivalente a ver Producto por Región
en un mes dado. Figura a).
✓ ¿Qué regiones han mejorado las ventas de un producto
dado a través del tiempo? Esto es equivalente a Región por
Tiempo de un producto dado. Figura b).
✓ ¿Cómo se venden los productos a través del tiempo en
una región dada ? Esto es equivalente a Producto por
Tiempo en una región dada. Figura c).
Figura a Figura b Figura c
Visualización de cubos
En este caso, las dimensiones son Producto, Tiempo y Región
aunque se podría agregar otra dimensión al cubo para permitir al
usuario visualizar cosas como, por ejemplo, Productos por
Cliente y responder preguntas tales como: ¿Qué cliente compró
la mayor cantidad de productos del tipo x?, pero en este caso el
cubo se vuelve más difícil de dibujar debido a que posee más de
3 dimensiones, de todas maneras el cubo funciona de la misma
forma y soporta n dimensiones, necesarias para representar a
cualquier problema del negocio de una compañía.
Visualización de cubos
Una metáfora muy usada para describir la
manera en que un cubo de datos OLAP se
puede cortar para visualizar los datos que tienen
tres o más dimensiones se denomina “slice and
dice”.
Modelos de almacenamiento
MOLAP, ROLAP y HOLAP
MOLAP
En un sistema MOLAP (OLAP multidimensional) los datos se
encuentran almacenados en una estructura multidimensional.
Para optimizar los tiempos de respuesta, el resumen de la
información es usualmente calculado por adelantado. Estos
valores precalculados o agregaciones son la base de las ganancias
de desempeño de este sistema.
Algunos sistemas utilizan técnicas de compresión de datos para
disminuir el espacio de almacenamiento en disco debido a los
valores precalculados.
ROLAP
ROLAP (OLAP Relacional) es un sistema en el
cual los datos se encuentran almacenados en
una base de datos relacional. Típicamente, los
datos son detallados, evitando las agregaciones y
las tablas se encuentran normalizadas. Los
esquemas más comunes sobre los que se trabaja
son estrella o copo de nieve, aunque es posible
trabajar sobre cualquier base de datos relacional.
HOLAP
Un sistema HOLAP (OLAP Híbrido) mantiene los
registros detallados en la base de datos relacional,
mientras que los datos resumidos o agregados se
almacenan en una base de datos multidimensional
separada. Este método de almacenamiento es una
combinación de los dos anteriores e intenta rescatar
lo mejor de cada uno.
Comparaciones
Comparaciones
El primer enfoque corresponde a MOLAP. Con este método,
los datos son precalculados y luego son almacenados en cubos
de datos multidimensionales.
El resultado se traduce en una mejor performance en los
tiempos de respuesta debido a que los datos se encuentran
disponibles sin necesidad de calcularlos en cada nueva consulta.
La desventaja de este enfoque se debe a que almacenar datos
multidimencionalmente ocupa mucho más espacio que con
ROLAP.
Comparaciones
El segundo enfoque es ROLAP donde los datos
son accedidos directamente del Data Warehouse
(u otro tipo de fuente relacional) y no son
almacenados por separado. Estos datos se
calculan en tiempo de consulta (al vuelo). Por lo
tanto el tiempo de respuesta sería mayor pero
sin usar enormes cantidades de almacenamiento
en disco.
Comparaciones
Las implementaciones MOLAP normalmente se
desempeñan mejor que la tecnología ROLAP,
pero tienen problemas de escalabilidad.
Las implementaciones ROLAP son más
escalables y son frecuentemente atractivas a los
clientes debido a que aprovechan las inversiones
en tecnologías de bases de datos relacionales
preexistentes
Comparaciones
La mejor solución probablemente esté entre los
dos extremos.
En muchos casos se utilizan HOLAP que
resultan de una combinación entre ROLAP y
MOLAP. HOLAP mantiene los volúmenes de
datos más grandes en la base de datos relacional
y las agregaciones en una base de datos MOLAP
separada, logrando con esto un balance entre
tiempo y espacio.
Data Mining
Data Mining
En una mina se desechan enormes cantidades
de material inservible antes de que oro o
diamantes sean encontrados.
Data Mining
El término Data Mining es una metáfora que
surge como analogía de lo anterior, y afirma
que con una computadora se puede encontrar
de manera automática un “diamante de
información” entre toneladas de datos
inservibles en una base de datos, teniendo en
cuenta que la información es un recurso muy
valioso para una compañía tanto como lo es
un diamante para un minero
Data Mining
Data Mining se ocupa del descubrimiento de
conocimiento oculto, patrones inesperados y
nuevas reglas a partir de grandes volúmenes de
datos. Actualmente se considera a Data Mining
el elemento clave de un proceso mucho más
elaborado llamado KDD, el cual está
estrechamente ligado a otro importante
desarrollo tecnológico, el Data Warehousing.
Proceso KDD
KDD
Si bien los términos Minería de Datos (Data
Mining) y Descubrimiento de Conocimiento en
Bases de Datos (Knowledge Discovery in
Databases o KDD) son usados como sinónimos
por algunos autores, el término KDD describe
el proceso completo de extracción de
conocimiento a partir de los datos.
KDD
Mientras que Data Mining se refiere
exclusivamente a la fase de descubrimiento del
proceso completo KDD. Esta confusión se
debe a que Data Mining era el término que se
usaba anteriormente para describir el proceso
entero de KDD.
Definición de KDD
“...la extracción no trivial de conocimiento
previamente desconocido y potencialmente útil
a partir de un gran volumen de datos en el cual
la información está implícita”. [Fayyad, 1996b].
Selección de los datos
En este paso se seleccionan los datos necesarios
para el análisis. En la mayoría de los casos, estos
datos se encuentran almacenados en bases de
datos operacionales usadas por los sistemas de
información de la organización.
Limpieza
Una tarea importante en la operación de limpieza es
la de eliminar registros duplicados (de-duplicación),
por ejemplo un cliente puede aparecer cargado 2
veces como consecuencia de un error de ortografía
al cargar su apellido.
Otro problema es la falta de consistencia de los
dominios, por ejemplo una transacción listada en
una tabla finalizada en 1901 pero la compañía se
estableció después de 1901.
Mejora
Agregar nueva información (datos
externos) y combinarla con los
registros existentes.
Codificación
Algunas veces la información contenida en la
base de datos no tiene el formato requerido por
los algoritmos de reconocimiento de patrones.
Algunos ejemplos de codificaciones incluyen
pasar de dirección a región, fecha de nacimiento
a edad, dividir ingresos por 1000, etc.
Data Mining
Aquí es donde realmente aparece la fase de
descubrimiento de conocimiento oculto y para
ello existen diferentes técnicas que se usan para
diferentes propósitos.
Técnicas de Data Mining
Procesamiento analítico en línea (OLAP)
Reglas de asociación
Arboles de decisión
Clustering
Reportes
Los resultados de la aplicación de Data Mining
se pueden mostrar en diferentes formatos. En
general, se pueden usar reportes o gráficos para
visualizar los resultados.
Diferentes formas de
conocimiento
Ing. Jonathan D. Nima Ramos
Conocimiento evidente
Esta es la información que se puede recuperar
fácilmente de bases de datos usando
herramientas de consulta tales como SQL.
Conocimiento
multidimensional
Esta es la información que se puede analizar
utilizando herramientas de procesamiento
analítico en línea OLAP. La mayoría de las cosas
que se pueden hacer con OLAP también
pueden hacerse utilizando SQL. La ventaja de
OLAP es que está optimizada para este tipo de
búsqueda y operaciones de análisis.
Conocimiento oculto
Estos datos se pueden encontrar fácilmente
con KDD y en particular con algoritmos de
Data Mining. Una vez más, se podría utilizar
SQL para encontrar estos patrones pero se
consumiría una enorme cantidad de tiempo.
Es decir, utilizando algoritmos de Data
Mining se pueden encontrar datos ocultos en
minutos, mientras que utilizando SQL se
tardarían meses para conseguir los mismos
resultados.
Conocimiento profundo
Esta es la información que está almacenada en la
base de datos pero sólo puede ser localizada si
se tienen pistas que indiquen donde buscar.