Preparação dos dados
Parte 3
c/ reamostragem e simulação
Módulo 5 (v1.0)
Complementos de Estatística para Ciência de Dados [CECD]
Mestrado em Análise de Dados e Sistemas de Apoio à Decisão [MADSAD]
Joana Leite |
Sumário
1. Recapitulando
2. Redução de dimensionalidade
2.1. Introdução
2.2. Seleção de variáveis
2.3. Agregação de variáveis
3. Reamostragem e Simulação
3.1. Tópicos de Estatística Computacional
3.2. Problemas de desbalanceamento
3.3. Avaliação de modelos preditivos
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 2
1. Recapitulando
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 3
Depois do Entendimento dos Dados vem a Preparação dos Dados
CRISP-DM
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 4
Principais objetivos e tarefas na Preparação dos Dados
§ Principais objetivos
§ Criar um conjunto de dados específico para a análise/projeto a realizar.
§ Melhorar a qualidade dos dados.
§ Formatar para permitir a utilização de uma ferramenta informática.
§ Transformar de acordo com as exigências de um certo método/técnica que se quer aplicar.
§ Principais tarefas
§ Integração de dados de várias fontes.
§ Limpeza dos dados atendendo aos problema de qualidade detetados.
§ Transformação dos dados, que pode incluir a adaptação de variáveis existentes e a criação
de novas variáveis a partir de variáveis existentes, bem como a criação de novos registos.
§ Redução dos dados, que pode incluir seleção de variáveis e combinação de variáveis com
técnicas de redução de dimensionalidade, bem como seleção de amostras de registos.
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 5
2. Redução de dimensionalidade
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 6
Introdução
§ A maldição da dimensionalidade (em inglês, the curse of dimensionality) está relacionada com o
rácio entre o número de instâncias e o número de variáveis do conjunto de dados.
§ Aumentar o número de variáveis sem aumentar o número de
instâncias faz com que o conjunto de dados fique esparso (em
inglês, sparse dataset), o que pode prejudicar a performance
dos modelos.
§ No entanto, para compensar o aumento do número de variáveis,
o número de instâncias tem que aumentar exponencialmente,
o que é, por regra, inviável.
§ Assim se percebe necessidade de ter técnicas para reduzir o número de variáveis, umas que
selecionam e outras que agregam as variáveis, de modo a ficar com um subconjunto de variáveis
menos correlacionadas entre elas.
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 7
Técnicas de redução de dimensionalidade
Técnicas de redução de
dimensionalidade
Seleção de variáveis (feature selection): Agregação de variáveis (feature aggregation):
mantém apenas as mais importantes cria novas variáveis a partir das variáveis disponíveis
Tipos Estratégias Análise de componentes principais
Filters Exhaustive Análise fatorial
Forward …
Wrappers
Backward
Embedded Bidirectional
…
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 8
Seleção de variáveis: Filter, Wrapper, Embedded
§ Há várias técnicas de seleção
de variáveis, classificadas em
técnicas:
§ Filter: se o processo de seleção
é independente do treino;
§ Wrapper: usam explicitamente
um classificador para guiar o
processo de seleção;
§ Embedded: a seleção faz parte
do algoritmo preditivo. Fonte: Xie et al. (2020)
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 9
Agregação de variáveis: Análise de Componentes Principais
§ Objetivo: com a Análise de Componentes Principais (PCA, do inglês Principal
Component Analysis) pretende-se resumir o conjunto de variáveis correlacionadas
num número mais pequeno de variáveis não correlacionadas, chamadas
componentes principais.
§ Cada componente principal é uma combinação linear das variáveis originais, o
que restringe as possibilidades de combinação, tornando o procedimento simples.
§ No entanto, estas componentes não têm significado em termos de interpretação.
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 10
Agregação de variáveis: Análise de Componentes Principais
§ Calculadas as componentes principais, estas são ordenadas da maior para a
menor variância. Isto significa que a primeira componente principal é a que
captura mais variabilidade nos dados originais, enquanto que as componentes
principais seguintes capturam quantidades de variação progressivamente
menores.
§ O número de componentes a considerar depende da quantidade de
variabilidade que se pretende manter.
§ O propósito é, então, reduzir a dimensionalidade, permitindo, por exemplo, a
visualização, sendo especialmente útil quando se tem mais do que três variáveis.
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 11
Agregação de variáveis: Análise de Componentes Principais
Fonte: “Principal Component Analysis: Explained Visually” de Victor Powell e Lewis Lehe
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 12
Análise de Componentes Principais (PCA, do inglês Principal Component Analysis)
Fonte: “Principal Component Analysis: Explained Visually” de Victor Powell e Lewis Lehe
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 13
3. Reamostragem e simulação
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 14
Tópicos de Estatística Computacional
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 15
Tópicos de Estatística Computacional
§ Reamostragem: métodos que partem
de uma única amostra obtida da
população de interesse, obtendo-se, a
…
partir dela, novas amostras.
§ Simulação: métodos que envolvem a
criação de dados por amostragem
pseudo-aleatória baseada numa
distribuição de probabilidade.
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 16
Conjunto de dados desbalanceado
Nestes dois casos, um classificador com uma taxa de acerto de 99% é igualmente bom?
Classificador Dummy: faz
previsões sem considerar as
variáveis independentes,
portanto, usa uma estratégia
que envolva apenas a
variável alvo.
Um exemplo é o classificador
classe maioritária, cuja
previsão é sempre igual ao
valor mais frequente da
Fonte: [Link] variável alvo.
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 17
Estratégias para lidar com o desbalanceamento
§ Há muitos algoritmos de aprendizagem
supervisionada que têm más performances
com conjuntos de dados desbalanceados.
§ Este problema é mais notório em tarefas
de classificação.
§ A solução passa por fazer uma combinação Undersampling da classe maioritária
das seguintes estratégias:
§ a redução de exemplos (i.e., undersampling)
da classe maioritária;
Conjunto de dados original
§ o aumento de exemplos (i.e., oversampling)
da classe minoritária; uma técnica é o
SMOTE, mas há outras.
Oversampling da classe minoritária
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 18
Aumento e/ou redução da amostra
Fonte: Le, T., Vo, M.T., Vo, B., Lee, M.Y., Baik, S.W. (2019). A Hybrid Approach Using Oversampling Technique and Cost-Sensitive Learning for Bankruptcy Prediction. Complexity.
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 19
SMOTE (Synthetic Minority Over-sampling TEchnique)
O primeiro passo é ignorar os
§ SMOTE é usado para aumentar a classe exemplos da classe maioritária.
minoritária (i.e., para fazer oversampling).
Para todas as instâncias da classe
§ Este aumento é feito gerando artificialmente minoritária, escolhem-se os k
vizinhos mais próximos.
novas instâncias para a classe minoritária.
§ Os novos exemplos são gerados por
interpolação com base nos k vizinhos mais
próximos (sendo k um híper-parâmetro).
São, então, criadas novas
instâncias entre cada instância
original e os seus vizinhos.
Fonte: Adaptado de “Learning from Imbalanced Classes” de Tom Fawcett
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 20
SMOTE (Synthetic Minority Over-sampling TEchnique)
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 21
SMOTE (Synthetic Minority Over-sampling TEchnique)
2002
2018
Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 22