Feedback – Proposta sobre ML e predição no mercado
financeiro
Síntese inicial (elogio + ressalva):
A proposta tem mérito ao buscar comparar métodos de machine
learning (ML) na previsão/seleção de ações. Entretanto, ainda que
você venha da Estatística e esteja em fase de proposta, o texto
precisa explicitar a base teórica de Economia e Finanças que
dá sentido ao exercício empírico. Em Economia, resultados só ganham
significado quando amarrados a hipóteses teóricas claras.
1) O que precisa entrar de teoria (essencial)
1. Hipóteses de eficiência de mercado (EMH): fraca,
semiforte, forte; e o que “prever retornos” implica sob cada
hipótese. Aqui entra inicialmente o trabalho de Fama.
2. Previsibilidade de retornos e anomalias: momentum,
reversão de curto prazo, value, size, quality, entre outras —
como a literatura as interpreta (risco x mispricing).
3. Modelos de precificação: CAPM e extensões (Fama-French
3/5 fatores), q-factor, etc., para você ter benchmarks
econômicos além dos estatísticos.
4. Microestrutura e fricções: custos de transação, bid-ask,
liquidez e turnover — o que é “ganho econômico” depois de
custos.
5. Risco x retorno (avaliação econômica): por que RMSE/MAE
não bastam; inclua métricas como Sharpe, Information
Ratio, alpha (sobre fatores) e lucro líquido após custos.
Objetivo teórico claro sugerido: “Testar se sinais extraídos de
preço/volume e fatores conhecidos geram previsibilidade
estatística e econômica de retornos em B3, em excesso a
modelos lineares/fatoriais sob restrições realistas de negociação.” –
Notar que se trata unicamente de uma proposta. Não há necessidade
de se prender à ela.
2) Escopo e recortes (para evitar dispersão)
Mercado-alvo: ações do IBOV (ou IBXX) para garantir liquidez.
Frequência: comece com diário ou semanal.
Janela temporal: ex.: 2012–2024 (sample – ou seja, irá
estabelecer a amostra para determinação da previsão) | 2025
(valores pelos quais irá prever e verificar o ajuste da previsão),
com cortes de regime (ou quebras estruturais – mas para
simplificar, pode adotar períodos sem esse tipo de efeito, por
exemplo, de 2023-2025, trabalhando com dados diários, e
prever os últimos meses de 2025).
Tarefa: escolha uma (ou duas) entre: (i) previsão de retorno
(regressão), (ii) direção do retorno (classificação), (iii) ranking
para long-only top-k.
3) Desenho metodológico (mínimo necessário e boas práticas)
1. Features:
o Técnicas: retornos passados, volatilidade realizada,
moving averages, RSI, volume/turnover, 52-week high.
o Fatoriais: value (B/M ou proxies), size (log-mcap),
momentum, quality (ROE), low-vol.
o (Opcional) Macros/sentimento: só se bem justificadas e
com defasagens para evitar look-ahead.
2. Modelos (comparação justa):
o Lineares: OLS/Lasso/Ridge (baseline).
o Árvores/conjuntos: Random Forest, XGBoost.
o (Opcional e parcimonioso) LSTM/Transformers, apenas se
justificar ganho sobre modelos tabulares.
3. Validação temporal correta: walk-forward/rolling window;
nada de K-fold aleatório. Use nested CV para tuning.
4. Viéses a controlar: look-ahead, survivorship bias (use
composição histórica), data-snooping (correção de
multiplicidade) e overfitting (regularização e early stopping).
5. Métricas:
o Estatísticas: RMSE/MAE (regressão), AUC/F1
(classificação), out-of-sample R² (Campbell-Thompson),
teste Diebold-Mariano entre forecasts.
o Econômicas: retorno médio, Sharpe, max drawdown,
alpha sobre fatores (FF3/FF5), turnover e P&L após
custos (inclua slippage).
6. Backtest realista: restrinja short, limite posição, imponha
custos por tick, e reporte sensibilidade dos resultados a custos
e rebalance.
7. Interpretação e transparência: importância de variáveis e
SHAP (ou permutation importance), para conectar os achados a
teorias (ex.: por que momentum ajuda? por que value falha em
janelas específicas?).
4) Hipóteses e testes (formulação clara)
H0 (eficiência fraca): nenhum modelo supera random walk
(mercados eficientes) / média histórica / CAPM/FF de forma
estatística e economicamente significativa fora da
amostra.
H1: há previsibilidade com ganho econômico (Sharpe/alpha>0)
robusto a custos, tuning e regimes.
5) Entregáveis e estrutura sugerida da proposta/artigo
1. Introdução: problema, contribuição (comparar ML com
modelos fatoriais tradicionais em B3 com avaliação econômica
realista).
2. Referencial teórico: EMH, anomalias, modelos fatoriais,
previsibilidade e limites à arbitragem.
3. Revisão de literatura (breve, mas focada): posicione seu
trabalho em relação a surveys e estudos aplicados.
4. Dados: universo (B3/IBOV), período, construção de features,
tratamento de dados, prevenção de viéses.
5. Metodologia: modelos, walk-forward, métricas estatísticas e
econômicas, controle de custos.
6. Resultados esperados: o que seria evidência pró/contra H0;
planos de robustez (regimes, subperíodos, alternativas de
custos).
7. Limitações: instabilidade de features, non-stationarity, risco de
overfitting, p-hacking.
8. Cronograma e reprodutibilidade: código organizado
(Jupyter/RMarkdown), seed e data dictionary.
6) Benchmarks mínimos (para a comparação ser crível)
RW (Random Walk) /naive: retorno = 0 (ou retorno médio
histórico). Parte do princípio de mercados eficientes.
AR/ARIMA (simples).
CAPM / Fama-French (time-series regression para medir
alpha).
Regressão linear com features (baseline tabular).
Melhor modelo de ML (regularização e validação temporal).
7) Referências úteis (mínimo para começar)
MINTARYA, L. N. et al. Machine learning approaches in stock
market prediction: A systematic literature review. Procedia
Computer Science, v. 216, p. 96-102, 2023.
ROSSI, A. G. Predicting stock market returns with machine
learning. Georgetown University, 2018.
(Sugiro ainda inserir ao menos um texto de EMH/anomalias e
um de Fama-French para dar sustentação teórica.)
Mensagem final ao aluno
João, sua proposta é promissora, mas precisa da teoria de
Finanças para que o exercício estatístico responda a hipóteses
econômicas bem definidas. Com os recortes, benchmarks e métricas
acima, você entrega um trabalho comparável à literatura e avaliável
tanto estatística quanto economicamente.