Resumo Mineração de dados (Data Mining)
1. Encontrar informações ocultas nos dados , Localizar padrões tendencias nos
dados com o uso de métodos não convencionais.
2. Tal que quanto mais próximo do pico da pirâmide maior o valor agregado a
informação
3. Fases do KDD (Knowledge Discovery in DataBases )
4. Conhecimento Indutivo (Generalizado), ou seja, os algoritmos a partir de seu
aprendizado inferem acerca do comportamento da população.
Descoberta de conhecimento em banco de dados;
Seleção -> Pré – Processamento -> Formatação -> Mineração de dados e
Interpretação / avaliação;
Mais uma vez o objetivo do Data Mining é a descoberta de regras e padrões nos dados
fornecidos;
Tal que na base da pirâmide tem um grande volume de dados disponíveis;
Importante enfatizar que o Data Mining é apenas um processo do KDD;
O KDD envolve todo o ciclo desde a coleta e preparação dos dados até a interpretação
com a consecutiva extração de conhecimento.
5. Características do Data Mining
Escalabilidade (Grande Volume de dados)
Alta Dimensionalidade (Muitos atributos – COLUNAS e VARIÁVEIS)
Dados complexos e heterogêneos (Dados em diversos Formatos sendo eles
estruturados e não estruturados)
Distribuição de dados (Dados em Diferentes lugares e sob diferentes domínios)
Análises não tradicionais (Uso de algoritmos Preditivos e Descritivos);
6. Fases do KDD
KDD é um processo que visa extrair conhecimento útil, novo, válido e compreensível a
partir de um grande volume de dados (Princípio do BIG DATA)
• Pré-Processamento: Análise de Outliers, redução de ruídos, estimativa de dados
faltantes, formatação dos dados, Discretização dos dados
• Transformação: Converter os dados para um formato adequado a mineração;
Normalização, criação de novas variáveis necessárias;
• Mineração de dados : Extrair padrões, tendencias dos modelos dos dados;
Aplicação de algoritmos de aprendizado de máquina ou estatística.
Técnicas como: classificação, regressão, agrupamento (clustering), associação (market
basket), detecção de anomalias, entre outras.
7. Modelo Crisp-DM
É um modelo composto por 6 fases cíclico sendo elas:
Business Understanding:
Entendimento do problema proposto
Data Understanding:
Conhecimento dos dados, ou seja, realizar a identificação das características dos dados,
Processo Exploratório dos dados
Data Preparation:
Tratamento dos dados
Modeling:
Uso de IA para achar padrões
Evaluation:
Verificação de padrões
Deploy:
Aplicação da regra de negócio
Tal que a sequência não é obrigatória, apenas simboliza o ciclo natural da mineração
8. Entendendo diferenças entre as técnicas de Data Mining (Objetivos do DATA MINING)
Previsão: Identificar comportamentos no futuro;
Identificação: Identificar item, evento ou atividade;
Classificação: Divisão dos dados / Categorizar os dados;
Otimização: Otimização de Recursos;
8.Técnicas de DATA MINING
a. Classificação : Aprendizado supervisionado (Dados são fornecidos)
b. Clustering (Agrupamento) : Segmentação / Clusterização dos dados (Medidas de Semelhança)
9. Tal que as tarefas do DM são divididas em :
Descritivas (Uso da estatística para descrever dados conhecidos – Correlação , Tendências,
outliers) ;
Tarefas de previsão (ocorre a partir de dados históricos) , ou seja, uso de IA para previsão ;
Tal que as variáveis são auxiliares (Independentes) e alvo (Dependentes);
Tal que o objetivo da IA é encontrar padrões nos dados permitindo inferir sobre o futuro a partir de
dados históricos;
PREDIÇÃO DESCRIÇÃO
CLASSIFICAÇÃO CLUSTERIZAÇÃO AMOSTRAGEM
REGRESSÃO ASSOCIAÇÃO SUMARIZAÇÃO
ANÁLISE DE DESVIO
Clusternig K-Means
A clusterização é uma tarefa Descritiva e não preditiva; ela pertence a área de aprendizado não
supervisionado, na qual não há rótulos (dados) pré-definidos, tal que o objetivo da clusterização é
agrupar os dados semelhantes entre si , sem saber previamente a que grupo pertencem.
Cluster = Formar Grupos, particiona um conjunto de dados em K grupos distintos
Na clusterização K-means os clusters são mutuamente exclusivos , ou seja, os dados pertencem a
apenas um grupo
“Clusterização é uma tarefa descritiva relacionada à identificação de grupos (clusters) de dados
semelhantes, em que os elementos de um cluster compartilham características comuns. Em
geral, os clusters são mutuamente exclusivos.”
K = é um número, que é escolhido representando a quantidade de grupos que se deseja classificar
os dados do algoritmo.
Forma automática
Algoritmo de IA não Supervisionado
Detecção de ANOMALIAS (DESVIO / MINERAÇÃO EXCEÇÕES)
Outliers = dados muito divergentes
-----------------------------------------------------------------------------------------------
Análise de REGRESSÃO
- Indica relação entre duas variáveis
- Preditivo (Futuro)
A Partir de uma série de valores históricos é retornado um valor
-----------------------------------------------------------------------------------------------------------------
Árvore de Decisão
-Preditivo (Futuro)
- Tomada de decisão a partir de perguntas realizadas de forma sequencial
Tal que os pontos (nós) = perguntas
Tal que os ramos = Respostas
Tal que as folhas das árvores = Decisões Finais
Nota-se que quanto mais perguntas são realizadas mais profundo se torna o modelo, ou seja,
mais estratos do modelo são formados
Na técnica de árvore de decisão, o processo principal é a estratificação dos dados, ou seja,
dividir o conjunto de dados em grupos mais homogêneos (ou “estratos”) em cada nó da árvore. A
ideia é separar os dados em subconjuntos que sejam mais “puros” em relação à variável alvo (por
exemplo, classe ou resultado).
• Cada divisão (ou “split”) cria uma estratificação dos dados, segmentando-os para
melhorar a precisão da classificação ou predição.
• Esse processo é repetido até que os grupos fiquem suficientemente puros ou um critério
de parada seja atingido.
10. OLAP X DATA MINING
OLAP : ONLINE ANALYTICAL PROCESSING é uma tecnologia utilizada para analisar grandes
quantidades de volumes de dados de forma rápida e interativa , ela permite que o usuário consulte
dados de diferentes formas.
Essas análises normalmente são feitas em cubos de dados, que organizam os dados em
dimensões e medidas.
Data Mining (Mineração de Dados) é o processo de descobrir padrões ocultos ou informações
valiosas nos dados, como prever tendências ou detectar fraudes.
• OLAP ajuda a explorar e visualizar os dados de forma eficiente.
• Data Mining vai além: ele tenta descobrir conhecimento novo a partir desses dados.
Tal que o OLAP explora os dados e o DATA MINING descobre os padrões.
Técnica de Associação (ANÁLISE DE REGRAS DE ASSOCIÇÃO) : É uma das principais técnicas de
data mining e seu objetivo é indicar um grau de afinidade (ou correlação) entre itens ou eventos
que ocorrem juntos.
TAL QUE NA CLUSTERIZAÇÃO HÁ REGRAS DE ASSOCIAÇÃO COM O OBJETIVO DE DESCOBRIR E
OBTER ESTRUTURAS DE ASSOCIAÇÃO ENTRE OS DADOS
SUPORTE X CONFIANÇA X LIFT
SUPORTE : Quantidade de vezes que aparece essa relação
CONFIANÇA : Mede se a porcentagem é alta ( Grau de certeza )
LIFT (Garante a não casualidade)
>1 : SIM
=1 : DEPENDE
<1 : NÃO