ESCUELA POLITÉCNICA NACIONAL 1
ESCUELA DE FORMACIÓN DE TECNÓLOGOS
ANÁLISIS DE DATOS
Introducción a Data
Warehousing
Paúl Guala, Nataly Guallichico, Elena Pérez
@[Link], [Link]@[Link], @[Link]
Resumen—En este documento damos a conocer una breve
introducción acerca de Data Warehousing, explicando su
funcionalidad y cómo podemos utilizarla con beneficios en
nuestras bases de datos, evitando así ralentizar el sistema para
poder satisfacer las necesidades de los usuarios, para esto
analizaremos algunos procesos avanzados de almacenamiento de
datos como OLAP y OLTP.
Abstract--- In this document we present a brief introduction
about Data Warehousing, explaining its functionality and how we
can use it with benefits in our databases, thus avoiding slowing
down the system in order to satisfy the needs of users, for this we
will analyze some advanced processes of data storage such as
OLAP and OLTP.
1.4 Data Staging y ETL
Características básicas de las diferentes capas de
arquitecturas:
Capa de preparación de datos: La capa de almacenamiento
temporal de datos aloja procesos ETL que extraen, integran y
limpian datos para alimentar la capa de almacén de datos.
Las operaciones del proceso ETL en su conjunto a menudo
se definen como reconciliación. Estos también son los más
ESCUELA POLITÉCNICA NACIONAL 2
ESCUELA DE FORMACIÓN DE TECNÓLOGOS
ANÁLISIS DE DATOS
complejo y técnicamente desafiante entre todas las fases del
proceso de almacenamiento de datos.
1.4.1 Extracción
Los datos relevantes se obtienen de fuentes en la fase de
extracción.
La extracción también se puede generar si puede reescribir
aplicaciones operativas para notificar de forma asincrónica los
cambios. Los datos a extraer se seleccionan principalmente en
función de su calidad.
Figure 2 Ejemplo de limpieza y transformado de los clientes.
1.4.4 Cargando
La carga en un almacén de datos es el último paso a dar.
Refresh se usa normalmente en combinación con
extracción estática para poblar inicialmente un
almacén de datos.
Update esta técnica se utiliza en combinación con la
extracción incremental. Actualiza los almacenes de
datos con regularidad.
1.5 Modelo Multidimensional.
La razón por la que el modelo multidimensional
se utiliza como paradigma del almacenamiento de datos, la
representación de datos está fundamentalmente conectada a
su facilidad de uso e intuición incluso para los principiantes de
TI. El modelo multidimensional comienza con la observación
Figure [Link]ón, transformación y cargando.
de que los factores que afectan.
1.4.2 Limpieza Un cubo multidimensional depende de un hecho relevante
para la toma de decisiones.
La fase de limpieza es crucial en un sistema de
almacenamiento de datos porque se supone que debe mejorar 1.5.1 Restricción
calidad de los datos, normalmente bastante deficiente en las Restringir datos significa separar parte de los datos de un
fuentes. cubo para marcar un campo de análisis.
Errores e inconsistencias más frecuentes que ensucian los
datos: 1.5.2 Agregación
Datos duplicados. La agregación juega un papel fundamental en las bases de
Valores inconsistentes. datos multidimensionales.
Datos faltantes.
Uso inesperado de campos. 1.6 Meta-data
Etc. El término metadatos se puede aplicar a los datos utilizados
Las principales funciones de limpieza de datos que se para definir otros datos. Se puede clasificar a los metadatos en
encuentran en las herramientas ETL son la rectificación y la 2 categorías.
homogeneización. Los metadatos internos definen fuentes de datos, procesos de
transformación, políticas de población, esquemas lógicos y
1.4.3 Transformación
físicos, restricciones y perfiles de usuario.
La transformación es el núcleo de la fase de reconciliación. Los metadatos externos son relevantes para los usuarios
Convierte datos de su operacional finales.
formato de origen en un formato de almacén de datos
específico.