0% acharam este documento útil (0 voto)
5 visualizações5 páginas

Mineração de Dados: Técnicas e Processos

A mineração de dados é um processo que busca descobrir padrões e informações ocultas em grandes volumes de dados, utilizando métodos não convencionais e técnicas como classificação, clustering e análise de regressão. O ciclo de Descoberta de Conhecimento em Banco de Dados (KDD) abrange desde a coleta e preparação dos dados até a interpretação e extração de conhecimento. O Data Mining se diferencia do OLAP, pois não apenas explora dados, mas também busca descobrir novos conhecimentos a partir deles.

Enviado por

garcia
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
5 visualizações5 páginas

Mineração de Dados: Técnicas e Processos

A mineração de dados é um processo que busca descobrir padrões e informações ocultas em grandes volumes de dados, utilizando métodos não convencionais e técnicas como classificação, clustering e análise de regressão. O ciclo de Descoberta de Conhecimento em Banco de Dados (KDD) abrange desde a coleta e preparação dos dados até a interpretação e extração de conhecimento. O Data Mining se diferencia do OLAP, pois não apenas explora dados, mas também busca descobrir novos conhecimentos a partir deles.

Enviado por

garcia
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

Resumo Mineração de dados (Data Mining)

1. Encontrar informações ocultas nos dados , Localizar padrões tendencias nos


dados com o uso de métodos não convencionais.
2. Tal que quanto mais próximo do pico da pirâmide maior o valor agregado a
informação
3. Fases do KDD (Knowledge Discovery in DataBases )
4. Conhecimento Indutivo (Generalizado), ou seja, os algoritmos a partir de seu
aprendizado inferem acerca do comportamento da população.

Descoberta de conhecimento em banco de dados;

Seleção -> Pré – Processamento -> Formatação -> Mineração de dados e


Interpretação / avaliação;

Mais uma vez o objetivo do Data Mining é a descoberta de regras e padrões nos dados
fornecidos;

Tal que na base da pirâmide tem um grande volume de dados disponíveis;

Importante enfatizar que o Data Mining é apenas um processo do KDD;

O KDD envolve todo o ciclo desde a coleta e preparação dos dados até a interpretação
com a consecutiva extração de conhecimento.

5. Características do Data Mining

Escalabilidade (Grande Volume de dados)

Alta Dimensionalidade (Muitos atributos – COLUNAS e VARIÁVEIS)

Dados complexos e heterogêneos (Dados em diversos Formatos sendo eles


estruturados e não estruturados)

Distribuição de dados (Dados em Diferentes lugares e sob diferentes domínios)

Análises não tradicionais (Uso de algoritmos Preditivos e Descritivos);

6. Fases do KDD

KDD é um processo que visa extrair conhecimento útil, novo, válido e compreensível a
partir de um grande volume de dados (Princípio do BIG DATA)
• Pré-Processamento: Análise de Outliers, redução de ruídos, estimativa de dados
faltantes, formatação dos dados, Discretização dos dados
• Transformação: Converter os dados para um formato adequado a mineração;

Normalização, criação de novas variáveis necessárias;

• Mineração de dados : Extrair padrões, tendencias dos modelos dos dados;

Aplicação de algoritmos de aprendizado de máquina ou estatística.

Técnicas como: classificação, regressão, agrupamento (clustering), associação (market


basket), detecção de anomalias, entre outras.

7. Modelo Crisp-DM

É um modelo composto por 6 fases cíclico sendo elas:

Business Understanding:

Entendimento do problema proposto

Data Understanding:

Conhecimento dos dados, ou seja, realizar a identificação das características dos dados,

Processo Exploratório dos dados

Data Preparation:

Tratamento dos dados

Modeling:

Uso de IA para achar padrões

Evaluation:

Verificação de padrões

Deploy:

Aplicação da regra de negócio

Tal que a sequência não é obrigatória, apenas simboliza o ciclo natural da mineração

8. Entendendo diferenças entre as técnicas de Data Mining (Objetivos do DATA MINING)

Previsão: Identificar comportamentos no futuro;

Identificação: Identificar item, evento ou atividade;

Classificação: Divisão dos dados / Categorizar os dados;


Otimização: Otimização de Recursos;

8.Técnicas de DATA MINING

a. Classificação : Aprendizado supervisionado (Dados são fornecidos)

b. Clustering (Agrupamento) : Segmentação / Clusterização dos dados (Medidas de Semelhança)

9. Tal que as tarefas do DM são divididas em :

Descritivas (Uso da estatística para descrever dados conhecidos – Correlação , Tendências,


outliers) ;

Tarefas de previsão (ocorre a partir de dados históricos) , ou seja, uso de IA para previsão ;

Tal que as variáveis são auxiliares (Independentes) e alvo (Dependentes);

Tal que o objetivo da IA é encontrar padrões nos dados permitindo inferir sobre o futuro a partir de
dados históricos;

PREDIÇÃO DESCRIÇÃO

CLASSIFICAÇÃO CLUSTERIZAÇÃO AMOSTRAGEM

REGRESSÃO ASSOCIAÇÃO SUMARIZAÇÃO

ANÁLISE DE DESVIO

Clusternig K-Means

A clusterização é uma tarefa Descritiva e não preditiva; ela pertence a área de aprendizado não
supervisionado, na qual não há rótulos (dados) pré-definidos, tal que o objetivo da clusterização é
agrupar os dados semelhantes entre si , sem saber previamente a que grupo pertencem.

Cluster = Formar Grupos, particiona um conjunto de dados em K grupos distintos

Na clusterização K-means os clusters são mutuamente exclusivos , ou seja, os dados pertencem a


apenas um grupo

“Clusterização é uma tarefa descritiva relacionada à identificação de grupos (clusters) de dados


semelhantes, em que os elementos de um cluster compartilham características comuns. Em
geral, os clusters são mutuamente exclusivos.”

K = é um número, que é escolhido representando a quantidade de grupos que se deseja classificar


os dados do algoritmo.

Forma automática
Algoritmo de IA não Supervisionado

Detecção de ANOMALIAS (DESVIO / MINERAÇÃO EXCEÇÕES)

Outliers = dados muito divergentes

-----------------------------------------------------------------------------------------------

Análise de REGRESSÃO

- Indica relação entre duas variáveis

- Preditivo (Futuro)

A Partir de uma série de valores históricos é retornado um valor

-----------------------------------------------------------------------------------------------------------------

Árvore de Decisão

-Preditivo (Futuro)

- Tomada de decisão a partir de perguntas realizadas de forma sequencial

Tal que os pontos (nós) = perguntas

Tal que os ramos = Respostas

Tal que as folhas das árvores = Decisões Finais

Nota-se que quanto mais perguntas são realizadas mais profundo se torna o modelo, ou seja,
mais estratos do modelo são formados

Na técnica de árvore de decisão, o processo principal é a estratificação dos dados, ou seja,


dividir o conjunto de dados em grupos mais homogêneos (ou “estratos”) em cada nó da árvore. A
ideia é separar os dados em subconjuntos que sejam mais “puros” em relação à variável alvo (por
exemplo, classe ou resultado).

• Cada divisão (ou “split”) cria uma estratificação dos dados, segmentando-os para
melhorar a precisão da classificação ou predição.
• Esse processo é repetido até que os grupos fiquem suficientemente puros ou um critério
de parada seja atingido.

10. OLAP X DATA MINING

OLAP : ONLINE ANALYTICAL PROCESSING é uma tecnologia utilizada para analisar grandes
quantidades de volumes de dados de forma rápida e interativa , ela permite que o usuário consulte
dados de diferentes formas.
Essas análises normalmente são feitas em cubos de dados, que organizam os dados em
dimensões e medidas.

Data Mining (Mineração de Dados) é o processo de descobrir padrões ocultos ou informações


valiosas nos dados, como prever tendências ou detectar fraudes.

• OLAP ajuda a explorar e visualizar os dados de forma eficiente.


• Data Mining vai além: ele tenta descobrir conhecimento novo a partir desses dados.

Tal que o OLAP explora os dados e o DATA MINING descobre os padrões.

Técnica de Associação (ANÁLISE DE REGRAS DE ASSOCIÇÃO) : É uma das principais técnicas de


data mining e seu objetivo é indicar um grau de afinidade (ou correlação) entre itens ou eventos
que ocorrem juntos.

TAL QUE NA CLUSTERIZAÇÃO HÁ REGRAS DE ASSOCIAÇÃO COM O OBJETIVO DE DESCOBRIR E


OBTER ESTRUTURAS DE ASSOCIAÇÃO ENTRE OS DADOS

SUPORTE X CONFIANÇA X LIFT

SUPORTE : Quantidade de vezes que aparece essa relação

CONFIANÇA : Mede se a porcentagem é alta ( Grau de certeza )

LIFT (Garante a não casualidade)

>1 : SIM

=1 : DEPENDE

<1 : NÃO

Você também pode gostar