0% acharam este documento útil (0 voto)
22 visualizações22 páginas

Reamostragem e Simulação em Dados

research

Enviado por

Pedro Soares
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
22 visualizações22 páginas

Reamostragem e Simulação em Dados

research

Enviado por

Pedro Soares
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

Preparação dos dados

Parte 3
c/ reamostragem e simulação
Módulo 5 (v1.0)

Complementos de Estatística para Ciência de Dados [CECD]


Mestrado em Análise de Dados e Sistemas de Apoio à Decisão [MADSAD]
Joana Leite |
Sumário

1. Recapitulando
2. Redução de dimensionalidade
2.1. Introdução
2.2. Seleção de variáveis
2.3. Agregação de variáveis
3. Reamostragem e Simulação
3.1. Tópicos de Estatística Computacional
3.2. Problemas de desbalanceamento
3.3. Avaliação de modelos preditivos

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 2


1. Recapitulando

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 3


Depois do Entendimento dos Dados vem a Preparação dos Dados

CRISP-DM

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 4


Principais objetivos e tarefas na Preparação dos Dados

§ Principais objetivos
§ Criar um conjunto de dados específico para a análise/projeto a realizar.
§ Melhorar a qualidade dos dados.
§ Formatar para permitir a utilização de uma ferramenta informática.
§ Transformar de acordo com as exigências de um certo método/técnica que se quer aplicar.

§ Principais tarefas
§ Integração de dados de várias fontes.
§ Limpeza dos dados atendendo aos problema de qualidade detetados.
§ Transformação dos dados, que pode incluir a adaptação de variáveis existentes e a criação
de novas variáveis a partir de variáveis existentes, bem como a criação de novos registos.
§ Redução dos dados, que pode incluir seleção de variáveis e combinação de variáveis com
técnicas de redução de dimensionalidade, bem como seleção de amostras de registos.

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 5


2. Redução de dimensionalidade

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 6


Introdução

§ A maldição da dimensionalidade (em inglês, the curse of dimensionality) está relacionada com o
rácio entre o número de instâncias e o número de variáveis do conjunto de dados.
§ Aumentar o número de variáveis sem aumentar o número de
instâncias faz com que o conjunto de dados fique esparso (em
inglês, sparse dataset), o que pode prejudicar a performance
dos modelos.
§ No entanto, para compensar o aumento do número de variáveis,
o número de instâncias tem que aumentar exponencialmente,
o que é, por regra, inviável.
§ Assim se percebe necessidade de ter técnicas para reduzir o número de variáveis, umas que
selecionam e outras que agregam as variáveis, de modo a ficar com um subconjunto de variáveis
menos correlacionadas entre elas.

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 7


Técnicas de redução de dimensionalidade

Técnicas de redução de
dimensionalidade

Seleção de variáveis (feature selection): Agregação de variáveis (feature aggregation):


mantém apenas as mais importantes cria novas variáveis a partir das variáveis disponíveis

Tipos Estratégias Análise de componentes principais

Filters Exhaustive Análise fatorial


Forward …
Wrappers
Backward
Embedded Bidirectional

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 8
Seleção de variáveis: Filter, Wrapper, Embedded

§ Há várias técnicas de seleção


de variáveis, classificadas em
técnicas:
§ Filter: se o processo de seleção
é independente do treino;
§ Wrapper: usam explicitamente
um classificador para guiar o
processo de seleção;
§ Embedded: a seleção faz parte
do algoritmo preditivo. Fonte: Xie et al. (2020)

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 9


Agregação de variáveis: Análise de Componentes Principais

§ Objetivo: com a Análise de Componentes Principais (PCA, do inglês Principal


Component Analysis) pretende-se resumir o conjunto de variáveis correlacionadas
num número mais pequeno de variáveis não correlacionadas, chamadas
componentes principais.
§ Cada componente principal é uma combinação linear das variáveis originais, o
que restringe as possibilidades de combinação, tornando o procedimento simples.
§ No entanto, estas componentes não têm significado em termos de interpretação.

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 10


Agregação de variáveis: Análise de Componentes Principais

§ Calculadas as componentes principais, estas são ordenadas da maior para a


menor variância. Isto significa que a primeira componente principal é a que
captura mais variabilidade nos dados originais, enquanto que as componentes
principais seguintes capturam quantidades de variação progressivamente
menores.
§ O número de componentes a considerar depende da quantidade de
variabilidade que se pretende manter.
§ O propósito é, então, reduzir a dimensionalidade, permitindo, por exemplo, a
visualização, sendo especialmente útil quando se tem mais do que três variáveis.

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 11


Agregação de variáveis: Análise de Componentes Principais

Fonte: “Principal Component Analysis: Explained Visually” de Victor Powell e Lewis Lehe

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 12


Análise de Componentes Principais (PCA, do inglês Principal Component Analysis)

Fonte: “Principal Component Analysis: Explained Visually” de Victor Powell e Lewis Lehe

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 13


3. Reamostragem e simulação

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 14


Tópicos de Estatística Computacional

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 15


Tópicos de Estatística Computacional

§ Reamostragem: métodos que partem


de uma única amostra obtida da
população de interesse, obtendo-se, a

partir dela, novas amostras.

§ Simulação: métodos que envolvem a


criação de dados por amostragem
pseudo-aleatória baseada numa
distribuição de probabilidade.

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 16


Conjunto de dados desbalanceado

Nestes dois casos, um classificador com uma taxa de acerto de 99% é igualmente bom?

Classificador Dummy: faz


previsões sem considerar as
variáveis independentes,
portanto, usa uma estratégia
que envolva apenas a
variável alvo.
Um exemplo é o classificador
classe maioritária, cuja
previsão é sempre igual ao
valor mais frequente da
Fonte: [Link] variável alvo.

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 17


Estratégias para lidar com o desbalanceamento

§ Há muitos algoritmos de aprendizagem


supervisionada que têm más performances
com conjuntos de dados desbalanceados.
§ Este problema é mais notório em tarefas
de classificação.
§ A solução passa por fazer uma combinação Undersampling da classe maioritária

das seguintes estratégias:


§ a redução de exemplos (i.e., undersampling)
da classe maioritária;
Conjunto de dados original
§ o aumento de exemplos (i.e., oversampling)
da classe minoritária; uma técnica é o
SMOTE, mas há outras.
Oversampling da classe minoritária

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 18


Aumento e/ou redução da amostra

Fonte: Le, T., Vo, M.T., Vo, B., Lee, M.Y., Baik, S.W. (2019). A Hybrid Approach Using Oversampling Technique and Cost-Sensitive Learning for Bankruptcy Prediction. Complexity.

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 19


SMOTE (Synthetic Minority Over-sampling TEchnique)

O primeiro passo é ignorar os


§ SMOTE é usado para aumentar a classe exemplos da classe maioritária.

minoritária (i.e., para fazer oversampling).

Para todas as instâncias da classe


§ Este aumento é feito gerando artificialmente minoritária, escolhem-se os k
vizinhos mais próximos.
novas instâncias para a classe minoritária.

§ Os novos exemplos são gerados por


interpolação com base nos k vizinhos mais
próximos (sendo k um híper-parâmetro).
São, então, criadas novas
instâncias entre cada instância
original e os seus vizinhos.
Fonte: Adaptado de “Learning from Imbalanced Classes” de Tom Fawcett

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 20


SMOTE (Synthetic Minority Over-sampling TEchnique)

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 21


SMOTE (Synthetic Minority Over-sampling TEchnique)

2002

2018

Joana Leite - CBS|ISCAC @ IPC CECD [MADSAD] - Módulo 5 (v2.0) 22

Você também pode gostar