WBA0749_v1.
Integração e Fluxo de Dados
(ETL)
Limpeza de dados
Bloco 1
Washington H. C. Almeida
Processo de limpeza de dados
• Muitas vezes, os dados estão em grandes
quantidades, apresentando dificuldades de
manipulação, e nem todos são necessários no
processo de ETL.
• Os dados se originam de diferentes fontes, quase
sempre heterogêneas, possuindo:
• Formatos diferentes.
• Campos nem sempre preenchidos.
• Campos duplicados.
Dados precisos
• Dados precisos apresentam as seguintes características:
• Corretos: os valores e descrições nos dados descrevem
seus objetos de verdade e devem estar corretos.
• Não ambíguos: os valores e descrições devem ter apenas
um significado.
• Consistente: os valores e descrições usam uma notação
para transmitir seus dados.
• Completo: o primeiro aspecto é garantir os valores e
descrições individuais nos dados estejam definidos para
cada instância.
Propriedades inter-relacionadas
• Quatro propriedades inter-relacionadas
moldam os objetivos de qualidade dos dados:
• Completude.
• Rapidez.
• Correção.
• Transparência.
Qualidade de dados ETL
Figura 1 – Prioridade na qualidade dos dados
Fonte: adaptado de Kimball e Caserta (2009, p. 119).
Conclusão
• A possibilidade de existir dados duplicados e inconsistentes em um
repositório é grande. Dessa forma, a limpeza de dados é de grande
importância para intervir nessas situações.
• A limpeza dos dados irá buscar preencher valores
faltantes, suavizar dados e corrigir
inconsistências presentes nos dados existentes.
Limpeza de dados
Bloco 2
Washington H. C. Almeida
Análise de perfil de dados
• Uma boa análise de perfil de dados, assume a
forma de um repositório de metadados específico,
descrevendo:
• Definições de esquema.
• Objetos de negócios.
• Domínios.
• Fontes de dados.
• Definições de tabelas.
Técnicas de preenchimento de dados
• Descarte de toda a tupla.
• Preenchimento manual do valor faltante.
• Uso de uma constante global para preencher o
valor faltante.
• Uso da média do atributo como valor a ser
substituído.
• Uso da média do atributo, calculada para todas
as amostras de uma mesma classe.
• Uso do valor mais provável do atributo como
valor a ser preenchido.
Binning
• Um ruído é uma variação ou erro aleatório
observado em uma variável medida.
• A compartimentalização (binning) é uma
técnica de remoção de ruído que suaviza
dados ordenados em compartimentos (bins).
• Como são consultados valores vizinhos a cada
dado, diz-se que é uma estratégia de
suavização local.
Regressão
• Outra técnica para remoção de ruídos é a
regressão, que consiste em suavizar os dados
substituindo-os pelo resultado de uma função
que os aproxime. Essa função pode ser:
• Regressão linear: aproxima os dados por uma
reta, plano ou hiperplano.
• Regressão não linear: dados são aproximados por
outras funções.
Regressão linear e não linear
Figura 2 – Regressão linear e não linear
Fonte: adaptada de Han e Kamber (2006).
Conclusão
• Valores podem faltar em uma base de dados,
por motivos como problemas no preenchimento
e armazenamento dos dados ou situações em
que os dados não devem estar presentes. Dessa
forma, é necessário o uso de técnicas de
preenchimento de dados.
• A limpeza de dados irá excluir ou substituir
valores duplicados, identificar valores nulos ou
inconsistentes, e também adequar na
distribuição dos dados.
Teoria em Prática
Bloco 3
Washington H. C. Almeida
Reflita sobre a seguinte situação
• Você precisa verificar um conjunto de dados de diversas fonte para, depois, poder
realizar análises com os dados consolidados. Em uma análise preliminar, verificou
que alguns campos com o CPF tem vários formatos em cada uma das fontes.
• O que você precisará fazer para resolver esse
problema? Já que apenas cruzar os dados sem
o processo de limpeza não trará resultados
devido os diversos formatos de CPF?
Norte para a resolução...
• O processo de qualidade de dados envolve várias etapas, incluindo data profiling,
verificação de valores válidos, consistência entre os valores, remoção de duplicidades,
além da verificação de regras e procedimentos de negócios complexos.
• Após este processo, os dados precisam estar corretos, não-ambíguos, consistentes e
completos. Pode ser utilizada alguma ferramenta para carregar esses dados e executar
a limpeza. O Data Integration do Pentaho é uma opção.
Figura 3 – Tela do Spoon do Data Integration
Fonte: captura de tela do Spoon do Data Integration.
Dica do(a) Professor(a)
Bloco 4
Washington H. C. Almeida
Ferramenta Pentaho Data Integration
• A ferramenta Pentaho Data Integration, pode ser utilizada para realizar a limpeza de dados.
• Ela possui vários componentes que podem agilizar o processo de modo gráfico.
Figura 4 – Tela do Spoon do Data Integration (02)
Fonte: captura de tela do Spoon do Data Integration.
Referências
HAN, J.; KAMBER, M. Data Mining: concepts and
techniques. Waltham: Elsevier, 2006.
KIMBALL, R.; CASERTA, J. The Data Warehouse ETL
Toolkit: practical techniques for extracting, cleaning,
conforming, and data delivering data. Indianopolis:
Wiley Publishing, 2009.
Bons estudos!