0% acharam este documento útil (0 voto)
12 visualizações21 páginas

Limpeza e Qualidade de Dados ETL

O documento discute técnicas de limpeza de dados, incluindo a remoção de dados duplicados, preenchimento de valores ausentes e suavização de dados para remover ruídos. Ele também descreve ferramentas como o Pentaho Data Integration que podem ajudar no processo de limpeza de dados.

Enviado por

Andre Mauricio
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
12 visualizações21 páginas

Limpeza e Qualidade de Dados ETL

O documento discute técnicas de limpeza de dados, incluindo a remoção de dados duplicados, preenchimento de valores ausentes e suavização de dados para remover ruídos. Ele também descreve ferramentas como o Pentaho Data Integration que podem ajudar no processo de limpeza de dados.

Enviado por

Andre Mauricio
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

WBA0749_v1.

Integração e Fluxo de Dados


(ETL)
Limpeza de dados
Bloco 1
Washington H. C. Almeida
Processo de limpeza de dados
• Muitas vezes, os dados estão em grandes
quantidades, apresentando dificuldades de
manipulação, e nem todos são necessários no
processo de ETL.
• Os dados se originam de diferentes fontes, quase
sempre heterogêneas, possuindo:
• Formatos diferentes.
• Campos nem sempre preenchidos.
• Campos duplicados.
Dados precisos
• Dados precisos apresentam as seguintes características:
• Corretos: os valores e descrições nos dados descrevem
seus objetos de verdade e devem estar corretos.
• Não ambíguos: os valores e descrições devem ter apenas
um significado.
• Consistente: os valores e descrições usam uma notação
para transmitir seus dados.
• Completo: o primeiro aspecto é garantir os valores e
descrições individuais nos dados estejam definidos para
cada instância.
Propriedades inter-relacionadas

• Quatro propriedades inter-relacionadas


moldam os objetivos de qualidade dos dados:
• Completude.
• Rapidez.
• Correção.
• Transparência.
Qualidade de dados ETL
Figura 1 – Prioridade na qualidade dos dados

Fonte: adaptado de Kimball e Caserta (2009, p. 119).


Conclusão

• A possibilidade de existir dados duplicados e inconsistentes em um


repositório é grande. Dessa forma, a limpeza de dados é de grande
importância para intervir nessas situações.

• A limpeza dos dados irá buscar preencher valores


faltantes, suavizar dados e corrigir
inconsistências presentes nos dados existentes.
Limpeza de dados
Bloco 2
Washington H. C. Almeida
Análise de perfil de dados

• Uma boa análise de perfil de dados, assume a


forma de um repositório de metadados específico,
descrevendo:
• Definições de esquema.
• Objetos de negócios.
• Domínios.
• Fontes de dados.
• Definições de tabelas.
Técnicas de preenchimento de dados

• Descarte de toda a tupla.


• Preenchimento manual do valor faltante.
• Uso de uma constante global para preencher o
valor faltante.
• Uso da média do atributo como valor a ser
substituído.
• Uso da média do atributo, calculada para todas
as amostras de uma mesma classe.
• Uso do valor mais provável do atributo como
valor a ser preenchido.
Binning

• Um ruído é uma variação ou erro aleatório


observado em uma variável medida.
• A compartimentalização (binning) é uma
técnica de remoção de ruído que suaviza
dados ordenados em compartimentos (bins).
• Como são consultados valores vizinhos a cada
dado, diz-se que é uma estratégia de
suavização local.
Regressão

• Outra técnica para remoção de ruídos é a


regressão, que consiste em suavizar os dados
substituindo-os pelo resultado de uma função
que os aproxime. Essa função pode ser:
• Regressão linear: aproxima os dados por uma
reta, plano ou hiperplano.
• Regressão não linear: dados são aproximados por
outras funções.
Regressão linear e não linear

Figura 2 – Regressão linear e não linear

Fonte: adaptada de Han e Kamber (2006).


Conclusão

• Valores podem faltar em uma base de dados,


por motivos como problemas no preenchimento
e armazenamento dos dados ou situações em
que os dados não devem estar presentes. Dessa
forma, é necessário o uso de técnicas de
preenchimento de dados.
• A limpeza de dados irá excluir ou substituir
valores duplicados, identificar valores nulos ou
inconsistentes, e também adequar na
distribuição dos dados.
Teoria em Prática
Bloco 3
Washington H. C. Almeida
Reflita sobre a seguinte situação

• Você precisa verificar um conjunto de dados de diversas fonte para, depois, poder
realizar análises com os dados consolidados. Em uma análise preliminar, verificou
que alguns campos com o CPF tem vários formatos em cada uma das fontes.

• O que você precisará fazer para resolver esse


problema? Já que apenas cruzar os dados sem
o processo de limpeza não trará resultados
devido os diversos formatos de CPF?
Norte para a resolução...
• O processo de qualidade de dados envolve várias etapas, incluindo data profiling,
verificação de valores válidos, consistência entre os valores, remoção de duplicidades,
além da verificação de regras e procedimentos de negócios complexos.
• Após este processo, os dados precisam estar corretos, não-ambíguos, consistentes e
completos. Pode ser utilizada alguma ferramenta para carregar esses dados e executar
a limpeza. O Data Integration do Pentaho é uma opção.

Figura 3 – Tela do Spoon do Data Integration

Fonte: captura de tela do Spoon do Data Integration.


Dica do(a) Professor(a)
Bloco 4
Washington H. C. Almeida
Ferramenta Pentaho Data Integration
• A ferramenta Pentaho Data Integration, pode ser utilizada para realizar a limpeza de dados.
• Ela possui vários componentes que podem agilizar o processo de modo gráfico.

Figura 4 – Tela do Spoon do Data Integration (02)

Fonte: captura de tela do Spoon do Data Integration.


Referências

HAN, J.; KAMBER, M. Data Mining: concepts and


techniques. Waltham: Elsevier, 2006.
KIMBALL, R.; CASERTA, J. The Data Warehouse ETL
Toolkit: practical techniques for extracting, cleaning,
conforming, and data delivering data. Indianopolis:
Wiley Publishing, 2009.
Bons estudos!

Você também pode gostar