Análise de Clusters
Análise de Agrupamento
Ana Meireles
Cláudia Silvestre
Análise de clusters
Segmentar segundo as restições alimentares
Intolerantes à lactose – Evitam laticínios.
Celíacos – Necessitam de produtos livres
de glúten.
Celíacos Diabéticos
Diabéticos – Preferem produtos sem
açúcar ou com baixo índice glicémico.
Alimentação Intolerantes
Alimentação funcional – Consomem funcional `à lactose
alimentos com benefícios adicionais para a
saúde (ex: ricos em antioxidantes,
probióticos).
-2-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
A análise de Clusters (AC) é uma técnica exploratória de agrupamento que se
propõe a maximizar a homogeneidade dentro dos grupos e ao mesmo tempo
maximizar a heterogeneidade entre grupos.
Objetivo: identificar grupos que tenham características semelhantes entre si e
que difiram substancialmente uns dos outros.
Á
Áreas de Aplicação:
Biologia
Medicina
Arqueologia
...
-3-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
A análise de Clusters (AC) é uma técnica exploratória de agrupamento que se
propõe a maximizar a homogeneidade dentro dos grupos e ao mesmo tempo
maximizar a heterogeneidade entre grupos.
Objetivo: identificar grupos que tenham características semelhantes entre si e
que difiram substancialmente uns dos outros.
Á
Áreas de Aplicação:
Biologia
Medicina
Arqueologia
...
-4-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Que grupos construir?
Quais os grupos naturais?
-5-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Árvore genealógica
Idosos
Adultos
Crianças
Segmentação por: Grupos etários
-6-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Segmentação por: Sexo
Masculino Feminino
-7-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Segmentação por: Semelhanças (uma possibilidade)
-8-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Tipo de caraterísticas:
• demográficas (género, idade, dim. agregado familiar)
• geográficas (regiões, países)
• psicográficas (atitudes, valores sociais, estilos de vida, crenças,
interesses e opiniões)
• comportamentais (hábitos de consumo, como e quando faz algo)
• critérios de vantagens/benefícios (vantagens/benefícios procurados no
consumo de determinado produto)
-9-
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Exemplo de segmentação demográfica/socio-
económica
Cluster 1 – Zonas Rurais Menos Desenvolvidas
Cluster 2 – Zonas Rurais Mais Desenvolvidas
Cluster 3 – Zonas Urbanas Litorais
Cluster 4 – As duas cidades Principais
(Desigualdades Regionais em Portugal Continental:
uma Análise Estatística Multivariada – Coutinho,
Marques e Soares, 1995)
- 10 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Exemplo de segmentação psicográfica
- 11 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Exemplo de segmentação de clientes: foco na gestão do cliente e não no
produto
- 12 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Processos de agregação:
Hierárquicos Não Hierárquicos
Segmentação por: Semelhanças Segmentação por: Género
Masculino Feminino
- 13 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Etapas do processo hierárquico
1. Escolher as variáveis de segmentação.
2. Seleccionar a medida de distância ou semelhança para comparar os
indivíduos.
3. Escolher o critério de agregação (ou desagregação) dos indivíduos.
4. Validar a solução.
- 14 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Medidas de aglomeração:
• Variáveis quantitativas
− Medidas de Distâncias
− Medidas de Semelhança (C. Correlação)
• Variáveis qualitativas
− Medidas de Semelhança (C. Associação)
- 15 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Critérios de agregação ou desagregação dos indivíduos
Vizinho mais próximo (Nearest neighbor)
Vizinho mais afastado (Furthest neighbor)
Média entre os grupos (Between-groups linkage)
Média dentro dos grupos (Within-groups linkage)
Centróide (Centroid clustering)
Mediana (Median clustering)
Ward (Ward’s method)
- 16 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exemplo
Exemplo: Como se poderiam agrupar estas 6 marcas de acordo com as suas
caraterísticas?
- 17 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters- Exemplo
Uma caraterística
Número de lojas Dimensão das lojas
- 18 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters- Exemplo
Feira Nova
Jumbo
Duas caraterísticas
Número de lojas vs % Alimentar nas vendas Número de lojas vs Dimensão das lojas
Continente
- 19 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exemplo
Todas as caraterísticas
Usando, por exemplo, o critério de
agregação do Vizinho mais próximo 1 2
(Nearest neighbor)
- 20 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exemplo
Método de agregação: Vizinho mais
próximo (Nearest neighbor)
d(1,2),3 = min(d13,d23) = min(12.2; 9.2) = 9.2
d(1,2),4 = min(d14,d24) = min(12.7; 9.9) = 9.9
d(1,2),5 = min(d15,d25) = min(2.3; 1.9) = 1.9
d(1,2),6 = min(d16,d26) = min(9.8; 7.4) = 7.4
1 3
Estatística Multivariada - 21 - 2 4
Ana Meireles
Cláudia Silvestre
Análise de clusters - Exemplo
Método de agregação: Vizinho mais
próximo (Nearest neighbor)
d(1,2),(3,4) = min(d(12),3,d(12,4) = min(9.2; 9.9) = 9.2
d(34),5 = min(d35,d45) = min(15.2; 17.1) = 15.2
d(34),6 = min(d36,d46) = min(4.3; 3.4) = 3.4
Matriz de distâncias - 3
1,2 3,4 5 6
1,2 0
3,4 9,2 0
5 1,9 15,2 0
6 7,4 3,4 13,8 0
5 1 3
Estatística Multivariada - 22 - 2 4
Ana Meireles
Cláudia Silvestre
Análise de clusters - Exemplo
Método de agregação: Vizinho mais
próximo (Nearest neighbor)
Matriz de distâncias - 3
d(1,2,5),(3,4) = min(d(12),(34),d5,(34)) = min(9.2; 15.2) = 9.2
1,2 3,4 5 6
d(1,2,5),6 = min(d(12),6,d56) = min(7.4; 13.8) = 7.4
1,2 0
3,4 9,2 0
5 1,9 15,2 0
6 7,4 3,4 13,8 0
Matriz de distâncias - 4
1,2,5 3,4 6
1,2,5 0
3,4 9,2 0
6 7,4 3,4 0 5 1 2
6 3
Estatística Multivariada - 23 - 4 Ana Meireles
Cláudia Silvestre
Análise de clusters - Exemplo
Método de agregação: Vizinho mais
Matriz de distâncias - 4 próximo (Nearest neighbor)
1,2,5 3,4 6
1,2,5 0
3,4 9,2 0
6 7,4 3,4 0
d(1,2,5),(3,4,6) = min(d(125),(34),d(125),6 =
= min(9.2; 7.4) = 7.4
Matriz de distâncias - 5
1,2,5 3,4,6
1,2,5 0
3,4,6 7,4 0
5 1 2
6 3
Estatística Multivariada - 24 - 4 Ana Meireles
Cláudia Silvestre
Análise de clusters - Exemplo
No SPSS
Critério de agregação : Vivinho mais próximo (Nearest neighbor)
- 25 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exemplo
O que acontece se usarmos diferentes critérios de agregação?
- 26 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exercício
Todas as caraterísticas
Usando, por exemplo, o critério de
agregação do Vizinho mais afastado
(Furthest neighbor)
- 27 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exemplo
Vizinho mais afastado Média entre os grupos
(Furthest neighbor) (Between-groups linkage)
- 28 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exemplo
Média dentro dos grupos Centróide
(Within-groups linkage) (Centroid clustering)
- 29 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - Exemplo
Mediana Ward
(Median clustering) (Ward’s method)
- 30 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters
Pontos para Reflexão:
A maioria dos métodos usados na AC são relativamente simples, não têm
um grande suporte estatístico.
Para um mesmo conjunto de dados, métodos de agrupamento diferentes
geralmente produzem soluções diferentes.
Na AC cada objecto é colocado num grupo. A chave da AC é saber
quando estes grupos são reais ou simplesmente impostos pelo método de
agrupamento.
- 31 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Dendrogramas
- 32 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Dendrogramas
- 33 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Dendrogramas
- 34 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Dendrogramas
- 35 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
Exemplo
Análise de Clusters no SPSS: método hierárquico
Considere os mesmo dados sobre o consumo de energia elétrica, obtido a
partir do site do INE.
As análises fatorial e de fiabilidade sobre estes dados sugeriram o seguinte
modelo com 3 fatores (depois de avaliada a fiabilidade dos fatores).
- 36 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
Fator 1: Consumo Urbano:
- Consumo doméstico
- Consumo não doméstico
- Iluminação das vias públicas
- Iluminação do interior dos edificios do estado.
Fator 2: Indústria
Fator 3: Agricultura
- 37 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters – método hierárquico:
Exemplo
Para se aplicar uma análise de Clusters (método hierárquico) a este modelo,
devem-se considerar os comandos:
- 38 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
Indicar as variáveis em
estudo (fatores)
Fazer agrupamento por
distritos (casos)
Nota: É opcional!
Só foi selecionada uma vez
que se tem indicação do
concelho
- 39 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
- 40 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
- 41 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
- 42 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
Escolher na janela principal da
análise de clusters para obter os outputs
(apresentam-se só alguns dos outputs)
- 43 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
Nesta tabela é apresentado o
esquema de aglomeração dos
diferentes distritos .
As colunas Cluster Combined
indicam a ordem de agregação
dos diferentes concelhos.
Os valores resultantes do
método de agregação ward
são apresentados na coluna
Coefficients.
- 44 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
Muito extenso.
“difícil” de interpretar
- 45 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
A % a selecionar deve
garantir a geração de
subamostras com cerca
de 30 indivíduos
Repetir novamente os comandos para obter
um novo dendrograma
- 46 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método hierárquico
Exemplo
Nota:
Os “passos” de geração de subamostras e
construção dos dendrogramas devem ser
repetidos, usando
• diferentes percentagens para geração das
subamostras;
• diferentes métodos de agregação.
Nota:
A informação obtida pode ser resumida numa
tabela onde, para cada dendrograma, se
regista, por exemplo:
• Dimensão da subamostra;
• Percentagem de casos considerados na
subamostra;
• Método de agregação;
• Distância corte;
• Número de clusters sugeridos;
• Segmentação
- 47 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método não
hierárquico (K-Means)
K- Means
k-means é um algoritmo de agrupamento amplamente usado no meio
académico e empresarial.
Entrada Saída
• Conjunto de dados (organizados) • Identificação dos elementos que
• Número de clusters: k pertencem a cada um dos k clusters
• Dimensão de cada cluster
- 48 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método não
hierárquico (K-Means)
Etapas do processo não hierárquico K- Means
1. Escolher as variáveis de segmentação.
2. Identificar o número de segmentos a usar (ou o número de
segmentos já é conhecido, ou precisa ser “encontrado”).
3. Aplicar o K-Means.
4. Validar a solução.
- 49 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método não
hierárquico (K-Means)
Para se aplicar uma análise de Clusters (método não hierárquico), devem-se
considerar os comandos:
- 50 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método não
hierárquico (K-Means)
Indicar as variáveis de
segmentação (fatores)
Indicar o número de segmentos
(tendo por base o dendrograma
anterior colocaríamos 3)
Nota: Por defeito o SPSS considera 2
clusters
Escolher na janela principal da
análise de clusters para obter os outputs
da segmentação
- 51 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters: método não
hierárquico (K-Means)
A validação da solução de segmentação, poderá ser feita por recurso, por
exemplo, a
• gráficos,
• tabelas,
• estatísticas descritivas;
• estatística inferencial;
• …
- 52 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
Exercício
Considere-se o ficheiro “2_2_VendasCombDistrito_2009.sav”.
Agrupe os concelhos de acordo com os gastos de energia, usando os fatores
como variáveis base de segmentação.
Passos:
1. Construir os fatores (já feito na AF)
2. Aplicar a análise de clusters:
2.1 Método hierárquico
2.2 K-means
- 53 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
1. Construir os fatores
- 54 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
2. Estudo de outliers
Verificar se existem outliers: realização do diagrama de extremos e quartis
- 55 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
2. Estudo de outliers (cont.)
Retirar os outliers: Lisboa (código 11), Porto (código 13) e Setúbal (código 15)
- 56 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
2. Estudo de outliers (cont.)
Retirar os outliers: Lisboa (código 11), Porto (código 13) e Setúbal (código 15)
- 57 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
Curiosidade
Representado graficamente usando apenas os 2 primeiros fatores,
suspeita-se da existência de 3 (ou 4 grupos)
- 58 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
Para se aplicar uma análise de Clusters (método hierárquico) a este modelo,
devem-se considerar os comandos:
Indicar as variáveis em
estudo (factores)
Fazer agrupamento por
distritos (casos): opcional
- 59 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
- 60 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
- 61 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
- 62 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
Escolher na janela principal da análise
de clusters para obter os outputs (apresentam-
se só alguns dos outputs)
- 63 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
Nesta tabela é apresentado o
esquema de aglomeração dos
diferentes distritos .
As colunas Cluster Combined
indicam a ordem de agregação
dos diferentes distritos.
Os valores resultantes do
método de agregação ward
são apresentados na coluna
Coefficients.
- 64 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
Repetindo a análise de clusters
Pode-se
considerar 4
grupos
- 65 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
K-Means
E escolher 4 grupos
- 66 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre
Análise de clusters - exercício
Output: K- Means
- 67 -
Ana Meireles
Estatística Multivariada
Cláudia Silvestre