0% acharam este documento útil (0 voto)
0 visualizações19 páginas

TrabalhoMatComp_

O projeto aborda a predição de intenção de compra em e-commerce utilizando regressão logística, visando melhorar a taxa de conversão, que atualmente é de apenas 15%. A análise de dados revelou padrões de comportamento dos usuários e a eficácia do modelo, que alcançou 87% de acurácia geral, além de otimizar a previsão de compradores reais. Os próximos passos incluem a exploração de modelos mais complexos para aprimorar ainda mais as previsões.
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
0 visualizações19 páginas

TrabalhoMatComp_

O projeto aborda a predição de intenção de compra em e-commerce utilizando regressão logística, visando melhorar a taxa de conversão, que atualmente é de apenas 15%. A análise de dados revelou padrões de comportamento dos usuários e a eficácia do modelo, que alcançou 87% de acurácia geral, além de otimizar a previsão de compradores reais. Os próximos passos incluem a exploração de modelos mais complexos para aprimorar ainda mais as previsões.
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

Matemática Computacional · COC351

Predição de Intenção de
Compra em E-commerce
Utilizando Regressão Logística e Otimização de Limiar

Integrantes: Matheus Xavier e Charles Ribeiro


Orientador: Leonardo Tanaka
2026.1
Agenda
01 Contexto e Definição do Problema 05 Processamento de Dados

02 Visão Geral do Dataset 06 Treinamento do Modelo

03 Metodologia 07 Resultados e Avaliação

04 Análise Exploratória de Dados 08 Conclusão e Próximos Passos


Contexto e Definição do Problema

12,330
O Desafio Central N° de Sessões
Em média, apenas 15 a cada 100 sessões em um e-commerce resultam
em venda. Diante dessa baixa conversão, errar a previsão traz
prejuízos: prever que um cliente não vai comprar quando ele iria
(Falso Negativo) custa receita perdida; prever que vai comprar quando
não iria (Falso Positivo) desperdiça verba de marketing. 84.5%
Não Compram
A pergunta central que o projeto responde é:
Com base no comportamento de navegação e no perfil
técnico/temporal do usuário na sessão atual, é possível prever se ele
finaliza a visita realizando uma compra?
15.5%
Concluem a Compra
Visão Geral do Dataset
Dataset: Online Shoppers Purchasing Intention — Repositório UCI Machine Learning

Estatísticas de Páginas Métricas do Google Analytics

Quantidade e tempo de permanência nas páginas visitadas Métricas padrão de desempenho de e-commerce (Taxa de
(Administrativas, Informativas e Relacionadas a Produtos). Rejeição, Taxa de Saída e Valor da Página).

Atributos Temporais Perfil do Usuário e Técnico

O contexto de quando a sessão ocorreu (Mês, Final de Semana, Dados do perfil do visitante (Sistema Operacional, Navegador,
Proximidade de Datas Especiais). Região, Tipo de Tráfego e Tipo de Visitante).

Variável Alvo: Booleano que indica se a receita foi gerada (Verdadeiro = Compra concluída).
Metodologia
Um pipeline estruturado de machine learning conectando os conceitos-chave do conteúdo programático da disciplina.

01 02 03 04 05 06

Regressão Busca de
EDA Preprocessing SMOTE Avaliação
Logística Extremos
Análise de distribuições
e padrões. Codificação One-Hot Balanceamento de Treinamento do Otimização do limiar Métrica F1, Curva ROC
Encoding. classes. modelo* (threshold).* e Matriz de Confusão.

*Os passos 04 e 05 aplicam diretamente tópicos da matéria: Regressão Logística e Busca de Extremos (Otimização).
04. Análise Exploratória de Dados (EDA)
Análise de Visitantes

Principais Insights:
[Link] 15,5% das sessões resultam em compra real.
2.O volume de acessos explode nos meses de Março, Maio Novembro e Dezembro.
04. Análise Exploratória de Dados (EDA)
Análise de Visitantes

Principais Insights:
[Link] 85% de todo o tráfego da plataforma é gerado por usuários recorrentes (Returning Visitors), evidenciando uma forte retenção.
[Link] duas fontes de tráfego (Tipos 1 e 2) concentram mais de 50% do volume total de acessos ao site.
04. Análise Exploratória de Dados (EDA)
Análise de Compradores

Principais Insights:
[Link] é o mês de ouro das conversões: O volume de compras atinge seu pico histórico absoluto em Novembro, impulsionado pelo
forte apelo comercial da Black Friday.
2.O primeiro semestre patina em vendas: Apesar de meses como Março e Maio apresentarem alto volume de acessos e curiosos no site, a
conversão real em vendas é proporcionalmente muito menor se comparada ao final do ano.
04. Análise Exploratória de Dados (EDA)
Análise de Extremos

Principais Insights:
1.O gráfico destaca instantaneamente quais colunas possuem a maior dispersão de dados e presença de valores discrepantes no topo do
gráfico, mostrando de forma bruta quais métricas têm comportamento mais instável no dataset.
Processamento de Dados
One-Hot Encoding
1
As colunas Month e VisitorType foram convertidas em colunas binárias via pd.get_dummies(). Isso garante que o modelo interprete
as variáveis categóricas corretamente.

SMOTE — Sobreamostragem Sintética


2
Aplicado apenas ao conjunto de treino. Gera amostras sintéticas da classe minoritária para balancear as classes sem contaminar o
conjunto de teste.

Divisão Train / Test (70% / 30%)


3
A divisão estratificada (stratified split) preserva a proporção de classes de 84,5% / 15,5% em ambos os subconjuntos (treino e teste),
prevenindo o vazamento de distribuição (distribution leakage).

StandardScaler
4
Ajustado (fitted) exclusivamente nos dados de treino e depois aplicado aos dados de teste — previne o vazamento de dados (data
leakage) e garante a convergência correta da Regressão Logística.
Processamento de Dados
One-Hot Encoding
1
Antes do One-Hot Encoding Depois do One-Hot Encoding
Processamento de Dados
SMOTE - Sobreamostragem Sintética
2
Processamento de Dados
Divisão Train / Test (70% / 30%)
3
Processamento de Dados
StandardScaler
4
Modelo — Regressão Logística

Como Funciona
A Regressão Logística estima a probabilidade de uma sessão resultar em uma compra real. O algoritmo combina os pesos de cada
variável comportamental em uma função linear e a converte através da função matemática Sigmóide, gerando um resultado
probabilístico contido estritamente no intervalo entre 0 e 1 (0% a 100%).
Resultados e Avaliação
Default (0.5) Optimized
Threshold
Acurácia 88% 87%

F1 (compradores - True) 0.57 0.59

Recall (compradores 0.51 0.61


identificados)
Precision (compradores) 64% 57%

Train Score 90.80% -

Test Score 90.49% 91%


Resultados e Avaliação
Conclusão
O que alcançamos

✓ 87% de acurácia geral em dados reais desbalanceados


✓ Otimização de threshold recuperou 59 compradores reais adicionais sem
degradar o modelo

Próximos Passos

Modelos mais complexos

Computational Mathematics — COC351 · Matheus Xavier e Charles Ribeiro


Obrigado!

Online Shoppers Purchasing Intention Dataset Repositório do projeto no GitHub

Computational Mathematics — COC351 · Matheus Xavier e Charles Ribeiro

Você também pode gostar