Introdução a Sistemas
Inteligentes
Modelos Machine Learning
Conceitos importantes
Profª. Suzana Mota
Modelo
de Machine
Learning
Modelos de Machine Learning
Um modelo é uma
representação matemática
encapsulada em formato
computacional que captura
padrões a partir de um conjunto
de dados.
Essa representação é utilizada
para realizar previsões,
classificações ou tomar decisões
com base em novos dados
Modelos de Machine Learning
Análise de Risco de Crédito: Qual o limite que você
pode possuir no cartão de crédito?
Recomendação de Filmes: Assistiu este item? Então
você vai se interessar por este outro
Perfil de Cliente: Qual a probabilidade deste perfil de
cliente comprar tal coisa? Ou cancelar a assinatura?
Detecção de Fraude: Este cliente é um potencial
fraudador?
Divisão de Dados
Os dados precisam ser divididos em treino e teste!
Para que não ocorra o overfitting, ou seja, para que eu tenha certeza que o
Modelo treinado foi capaz de identificar padrões em dados que ele não conhece!
70% 30%
80% 20%
Dados de Treino Dados de Teste
Conjunto de dados utilizado para treinar Conjunto de dados separados para
o modelo. avaliar o desempenho do modelo.
O modelo aprende os padrões e as Os dados de teste simulam novos
relações presentes nesses dados. dados reais, ajudando a verificar se o
modelo consegue generalizar para
dados que ele ainda não viu.
Por que separar os dados?
Prevenção de Overfitting:
● Ao usar dados de treino para ajustar o modelo e dados de teste para avaliar,
evitamos que o modelo se ajuste demais aos dados de treino (overfitting).
Avaliação Realista:
● Dados de teste fornecem uma medida mais realista de como o modelo
funcionará no mundo real com dados não vistos.
Por que separar os dados?
O modelo realmente aprendeu? Como o Como o modelo se
O modelo generalizou o suficiente? modelo se comporta no mundo
sai com real, com dados que
dados ele nunca viu?
novos?
Por que separar os dados?
Será que você aprendeu Funciona mesmo?
mesmo? Vamos ver com dados do
Tome dados que você nunca viu mundo real
Tome uns dados para aprender!
Separando os dados
SEMENTE
30% TESTE
RANDÔMICA
X_TREINO Y_TREINO
Features Labels
X_TESTE Y_TESTE “Respostas Certas”
Conceitos Importantes
Overfitting (sobreajuste)
É um problema comum em
modelos de machine learning,
que ocorre quando o modelo
se ajusta muito bem aos
dados de treinamento, mas
tem desempenho ruim em
novos dados.
Overfitting (sobreajuste)
Aqui temos a acurácia (a porcentagem de acertos do modelo)
No treinamento, chega a 100% de acertos
No teste, com dados novos, fica em 90%
É um grande indício de overfitting
Overfitting (sobreajuste)
Causas de Overfitting
Modelo excessivamente complexo:
● Modelos muito complexos, como redes neurais profundas ou árvores de
decisão muito profundas, tendem a capturar padrões irrelevantes.
Poucos dados de treinamento:
● Quando o conjunto de dados de treinamento é muito pequeno, o modelo
pode aprender os detalhes específicos desse conjunto, mas não consegue
generalizar para novos dados.
Ruído nos dados:
● O modelo pode aprender padrões com base em ruídos ou outliers dos
dados, o que não é desejável.