0% acharam este documento útil (0 voto)
4 visualizações6 páginas

Previsão de Ações com Big Data e LPN

O documento propõe um processo de predição de preços de ações utilizando Big Data e estatísticas bayesianas para auxiliar investidores no mercado financeiro. A pesquisa explora a coleta de dados em tempo real de notícias financeiras e a aplicação de modelos preditivos, como o Naive Bayes, para melhorar a precisão das decisões de compra e venda de ações. O estudo destaca a importância da Linguagem de Processamento Natural na análise de sentimentos das notícias e na previsão de oscilações de preços.

Enviado por

ricardoeuro
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
4 visualizações6 páginas

Previsão de Ações com Big Data e LPN

O documento propõe um processo de predição de preços de ações utilizando Big Data e estatísticas bayesianas para auxiliar investidores no mercado financeiro. A pesquisa explora a coleta de dados em tempo real de notícias financeiras e a aplicação de modelos preditivos, como o Naive Bayes, para melhorar a precisão das decisões de compra e venda de ações. O estudo destaca a importância da Linguagem de Processamento Natural na análise de sentimentos das notícias e na previsão de oscilações de preços.

Enviado por

ricardoeuro
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

III Escola Regional de Informática do Piauí. Livro Anais - Artigos e Minicursos, v. 1, n. 1, p. 224-229, jun, 2017.

[Link]/2017 - ISBN: 978-85-7669-395-6

Big Data e computação preditiva para suporte a decisões no mercado


financeiro

André H. Hayashi
IPT – Instituto de Pesquisas Tecnológicas – São Paulo - Brasil
[Link]@[Link]
Abstract. Abstract — The financial market is very fickle and investors have the
difficult task of following and trying to predict the swings of the market so that their
strategies result in better financial returns. With the use of Big Data and Bayesian
mathematical statistics based on prior knowledge and examples of training to
determine the likelihood of a hypothesis, financial news can be tracked continuously
and affecting key financial indicators, Actions and assisting the investor. The
objective of this work is to propose a stock price prediction process of a company
listed on the Ibovespa to support decisions in the financial market, helping an
investor to better buy and sell stocks using a predictive system with Big Data and
Natural Processing Language (LPN) to collect real-time information from news sites
that may influence stock prices.

Resumo. O mercado financeiro é muito inconstante e os investidores tem a difícil


tarefa de acompanhar e tentar prever as oscilações do mercado para que suas
estratégias resultem em melhores retornos financeiros. Com a utilização do Big Data
e estatísticas matemáticas bayesianas baseado no conhecimento prévio e exemplos
de treinamento para determinar a probabilidade de uma hipótese, pode-se
acompanhar as notícias financeiras de forma contínua e que afetam os principais
indicadores financeiros, sendo possível prever os preços das ações e auxiliando o
investidor. O objetivo deste trabalho é propor um processo de predição de preços
das ações de uma empresa listada no Ibovespa para suporte a decisões no mercado
financeiro, auxiliando um investidor para um melhor momento de compra e venda de
ações com o uso de um sistema preditivo com Big Data e Linguagem de
Processamento Natural (LPN) para coletar informações em tempo real oriundas de
sites de notícias e que podem influenciar os preços das ações.

1. Introdução
O mercado financeiro, mesmo sendo controlado por órgãos regulamentadores é muito
inconstante. Sua inconstância pode ser influenciada por vários fatores como crise econômica,
mudanças políticas e governamentais, alterações no mercado exterior, fusões e aquisições de
empresas, catástrofes naturais ou provocadas e outros fatores econômicos. Os investidores
possuem a difícil tarefa de acompanhar de forma contínua as oscilações do mercado para que
suas estratégias resultem em melhores retornos financeiros. Com o Big Data pode-se coletar
diversas informações da Internet de forma automática como notícias políticas e econômicas,
acompanhar as variações dos preços das ações em tempo real, e muitas outras notícias
relevantes e que podem influenciar os indicadores financeiros e os preços das ações. Um
modelo muito utilizado para predições é o modelo Bayesiano, que é fundamentado no teorema
de Bayes. Naive Bayes utiliza um classificador probabilístico [1] com as regras de Bayes para
realizar predições. Com o classificador Naive Bayes [2], é possível por exemplo, realizar a
predição de valores do índice da bolsa de valores de Londres FTSE100. O Naive Bayes utiliza o
aprendizado Bayesiano para treinar os classificadores. O aprendizado Bayesiano utiliza um
modelo probabilístico baseado no conhecimento prévio do problema [3], que é combinado com
exemplos de treinamento para determinar a probabilidade final de uma hipótese. A linguagem
de processamento natural contribui para analisar estados diretos e indiretos se os preços das
ações dos textos extraídos da Internet subirá, descerá ou se manterá no mesmo valor. Analisar o
sentimento da notícia [12] envolve reconhecer e definir o "estado emocional" expresso no texto.
Este trabalho contribui para a utilização do classificador Naive Bayes para predição da bolsa de
valores de Londres [2] especialmente na utilização do Big Data, pouco explorado na
bibliografia levantada auxiliando um investidor nas decisões financeiras apresentando o melhor
momento para compra e venda de ações. Adicionalmente será aprofundado estudos de predição
com Naive Bayes, utilização do Naive Bayes com RCran; classificação de textos para processo
de predição dos preços das ações com a linguagem de processamento natural e utilização do Big
Data e que podem servir como ferramenta de análise financeira ou ainda adaptada para outro
segmento.
2. Teorema de Bayes
O teorema de Bayes tem sido utilizado em áreas como finanças, biologia, seguradoras,
sistemas que evitam fraudes e outras, nas quais se deseja realizar predições probabilísticas. O
teorema de Bayes é baseado na probabilidade condicional e probabilidade conjunta. Para a
realização das predições probabilísticas será utilizado o Naive Bayes, que é um classificador
probabilístico que utiliza as regras de Bayes.

Fórmula 1. Classificador Naive Bayes [1]


O Naive Bayes utiliza o aprendizado Bayesiano para treinar os classificadores. O
aprendizado Bayesiano utiliza um modelo probabilístico [3] baseado no conhecimento prévio
do problema, que é combinado com exemplos de treinamento para determinar a probabilidade
final de uma hipótese. É possível melhorar a predição com treinamento dos classificadores.
3 – Comparativo do classificador Naive Bayes, K-Nearest Neighbor, Support Vector
Machine
No experimento [11], o classificador Naive Bayes foi comparado a outros
classificadores K-Nearest Neighbor (KNN), Support Vector Machine (SVM). Os três
classificadores foram submetidos a testes de tráfego de dados na Internet em diferentes tipos de
serviços. Os seguintes serviços foram analisados: http, smtp, ftp, pop3, nntp, msn, edonkey, ssh,
bittorrent e https. Para o experimento foram utilizados o total de 13 536 fluxos de dados com
50 fluxos de classes de treinos para os 3 classificadores.

Tabela 1. Comparativo de eficiência individual dos classificadores KNN, SVM e Naive Bayes.
O autor não forneceu maiores detalhes, mas a média de resultados foram 93.18 % para
o K-Nearest Neighbor, 81.32 % para Support Vector Machine e 94.4 % de precisão para o
Naive Bayes com a maior pontuação. Para o protocolo HTTP, o classificador Naive Bayes ficou
em segundo com 94,1 % enquanto para POP3 ficou em primeiro com 97,35 %. Percebe-se
também que para HTTPS e SSH que utilizam criptografia, o Naive Bayes teve uma nota baixa e
se fosse seguido esse raciocínio, esse classificador poderia não ser tão eficiente com a
utilização de protocolos seguros comparado aos outros dois classificadores.
4. Big Data e Lingagem de Processamento Natural
Atualmente o alto volume de dados [4] como registros de navegações, textos e
documentos, transações comerciais, registros bancários, gráficos financeiros, imagens médicas,
vídeos de vigilância, marketing, telecomunicações, dados de mídias sociais podem ser
facilmente coletadas ou geradas de diferentes fontes, em diferentes formatos em diferentes
aplicações em tempo real na era do Big Data. Os textos coletados pelo Big Data não
apresentam informações úteis por si só. É necessário a extração das informações dos textos
coletados que ajudem a predição dos valores das ações. A linguagem de processamento natural
permite que os textos extraídos pelo Big Data sejam analisados e classificados, permitindo uma
percepção positiva e ou negativa da notícia, indicando se o valor da ação subirá ou descerá.
Essa percepção acontece em tempo real e de forma automática, ajustando o valor da predição e
apresentando graficamente. Com esse ajuste em tempo real, o sistema busca acompanhar as
várias oscilações no mercado financeiro trazendo uma predição mais próxima possível da
realidade e auxiliando o investidor.
5 - Método e Métrica de Avaliação
O objetivo da pesquisa proposta é uma pesquisa exploratória. A pesquisa exploratória
visa prover o pesquisador [10] um conhecimento maior sobre o tema ou problema em análise.
Por isso é apropriada para o início da investigação quando o conhecimento, a compreensão e
familiaridade do pesquisador são insuficientes ou inexistentes. O método de trabalho foi
dividido em 5 fases. Sendo:

Tabela 2. Fases do método de trabalho.


Fase 1: Nesta fase foram realizadas pesquisas em livros e artigos relacionados a predição da
bolsa de valores de Londres [2], e a utilização da linguagem de processamento natural [12] para
classificação das informações extraídas dos sites. Essas referências são utilizadas para
fundamentação deste trabalho.
Fase 2: Nesta fase foram levantados dois tipos de dados, utilizados: coleta de informações
extraídas de sites financeiros e coleta dos valores dos preços das ações durante o horário de
negociações do Ibovespa, sendo de segunda a sexta, das 10 ás 17:00 horas de minuto a minuto.
Fase 2 parte 1: O primeiro tipo de dado, refere-se a coleta de informações de diferentes sites
financeiros, de notícias sobre a empresa analisada, de economia, política e outras notícias
relevantes. O objetivo desta coleta é a classificação de textos com a utilização da linguagem de
processamento natural e que pode impactar sobre os preços das ações.
Fase 2 parte 2: O segundo tipo de dado a ser coletado é o de cotação, em períodos curtos de
um em um minuto, do preço da ação de uma empresa listada no Ibovespa. O objetivo desta
coleta é a de observar as variações no preço da ação ao longo do pregão. Esta informação será
armazenada em um banco de dados e comporá um histórico para a realização da predição do
preço da ação. A empresa escolhida para análise é a Companhia de Bebidas das Américas
(Ambev) cujo código das ações no Ibovespa é representado por Abev3.
Fase 3: Para a coleta dos dados da fase 2, parte 1, é utilizado o Big Data Hadoop em um
ambiente virtualizado com 2 nós, sendo 1 computador mestre e 1 computador escravo. O
MapReduce é responsável pelo processo de obter as partes das informações nos computador
escravo, processá-lo e juntá-lo no computador mestre. Para os dados do item 2, parte 2, foi
desenvolvido um programa em Java para capturar por um site os valores das ações e os inserir
em um banco de dados estruturado. Com o R-Cran configurado e habilitado o pacote Naive
Bayes E1071 e suas funçoes Naive Bayes e Predict é possível realizar os cálculos matemáticos
preditivos com os dados coletados. Fase 4: Os testes foram divididos em duas partes.
Fase 4 parte 1: Nesta fase serão realizados os testes de predição com as variações do histórico
dos preços das ações com Rstudio.
Fase 4 parte 2: Nesta fase serão realidos os testes dos textos extraídos pelo Big Data para
análise da classificação de textos em um programa desenvolvido em Python com a LPN.
Fase 5: Nesta fase seráo apresentados os resultados da análise obtidos após a realização do
experimento. Serão analisados os resultados da predição e comparados com o valor obtido das
ações durante o pregão eletrônico e analisado sua aferição. Caso a aferição do processo
preditivo apresente resultados muitos diferentes do real, será investigado suas possíveis causas
e proposto melhorias. A métrica proposta para este trabalho está dividido em duas partes:
1. Porcentual médio da predição alcançada em relação ao valor real da ação.
2. Porcentual de acertos da classificação de textos.
Para o cálculo do item 1, será disponibilizado em tabelas todos os registros da coleta
dos preços real e da predição. Será calculado a média dos preços de todos os dias das duas
tabelas. Será calculado o porcentual alcançado da predição em relação ao preço real de todos os
registros. Após isso, serão contabilizados todos os valores em que o percentual da predição
alcançou valor menor e igual a 1 % positivo e negativo. Para o cálculo do item 2, serão
analisados todos os textos coletados pelo Big Data de forma manual e comparado com o
resultado da linguagem de processamento natural gerando um percentual de acerto.
6. Experimento
Para o experimento, foi criado uma arquitetura em ambiente virtualizado com um
computador principal e secundário para o Apache Hadoop 2.7.3, e linguagem e ambiente para
computação estatística R para geração da predição. Para a extração dos preços das ações na
Internet, foi desenvolvido um programa em Java, no qual o site é capturado em HTML, extraído
as informações e armazenado em banco de dados MySQL.

Figura 1. A esquerda é apresentada a arquitetura Hadoop Big Data com computador principal e
secundário e a direita é apresentada a arquitetura de extração de dados para coleta de preços das ações.
A coleta de dados dos preços iniciou-se em 03/05/2016 a 29/03/2017 ou 374 dias de
registros que armazenam os valores das ações de minuto a minuto da empresa abev3, durante o
pregão eletrônico se segunda a sexta-feira das 10:00 ás 17:00. A predição é executada no R-
Cran diariamente conforme a figura 1, sempre até o dia anterior do pregão eletrônico, gerando a
predição para o próximo dia. Com as funções Naive Bayes e Predict da ferramenta estatística R,
foi criado um gráfico preditivo dos preços das ações da empresa Ambev do dia seguinte,
analisando o histórico até seu dia anterior, conforme mostrado na figura 4. Nesse gráfico é
possivel identificar o preço máximo e mínimo que o valor da ação atingirá, e também seu
melhor momento para compra e venda.

Figura 2 – Gráfico dos preços das ações da Ambev preditivo e real do dia 18/01/2017
A linha roxa representa os preços das ações obtidos durante o preção eletrônico, e a
linha verde representa a predição realizada previamente e antes do pregão do dia. A predição no
exemplo, ficou aproximandamente R$ 0,20 centavos abaixo do preço real ao longo do dia. Essa
diferença no preço é minimizada com a utilização do Big Data. No Big Data e com a utilização
do Hadoop Streaming foi desenvolvido um programa em Python para a utilização da
Linguagem de Processamento Natural (LPN). A coleta de dados dos sites financeiros iniciou-se
em 30/jan/2017 até 29/03/2017 e posui 21 778 textos com um tamanho total de 2.9 Gbytes de
espaço ocupado. Foram armazenados notícias de 07 sites financeiros em intervalos de 15
minutos. Os textos extraídos dos sites de notícias financeiras precisam serem preparados pela
LPN. Esse processo inclui converter todos os maiúsculos para minúsculo, remover pontuações
e números, utilização de palavras de paradas ou "stop words", lematização e a criação de um
dicionário específico para identificação de palavras chaves que indicam as condições da ação.

Figura 3. Fluxo de dados da coleta de notícias até a predição.


A figura 4 apresenta a fluxo de dados da coleta até ser adicionado na predição. Após o
processamento da LPN, será apresentado um resultado positivo ou negativo informando se os
preços da ação subirá ou descerá. Se o resultado for positivo, será adicionado o resultado da
fórmula de aferição da figura 3, se negativo subtraído.

Fórmula 2. Fórmula de aferição de preços do Big Data.


Na figura 5, a linha azul como resultado do processamento de textos do Hadoop,
aproximou-se em 5 % mais do valor real do preço das ações (linha roxa).

Figura 4. Gráfico dos preços das ações da Ambev preditivo e real e com a inclusão do resultado do
Hadoop do dia 18/01/2017.

Nesse momento não está sendo realizado a análise de sentimentos de analistas de


investimentos pois existem muitos fatores especulativos que são publicados livremente na
Internet e muitas vezes não expressam a realidade. Normalmente opiniões confiáveis de
especialistas financeiros não são publicados gratuitamente na Internet, sendo normalmente
serviços pagos e que são ofertados por bancos e corretoras.

5. Conclusões
A predição na média geral realizado em 374 dias de medição manteve-se próximo do
valor real da ação. A linha vermelha do gráfico da Figura 7 representa a média de todos os
valores de cada dia do valor real da ação, e a linha verde representa a predição alcançada.
Figura 5. Gráfico da média preditiva e real de 374 dias.
 Total de registros: 158 202
 Total de dias medidos: 374
 Média de acertos da predição até 1 % acima ou abaixo do valor real da ação: 55.92 %
 Valor médio da predição sob o valor real da ação: manteve-se 0,20 centavos acima.
 Valor máximo da média da variação da diferença do real e a predição: de 1.31 e -0.96
 Valor da predição igual ao valor real: 2 443 acertos ou 1.54 %
A classificação de textos com a linguagem de processamento natural obteve 48.34 % ou
10 527 de 21 778 textos classificados corretamente. Existem várias formas de escritas e
sentidos das frases que em algums momentos prejudicaram o resultado correto da classificação
de textos. Fases como “A Ambev teve uma alta de 2%.” são identificados corretamente. Frases
como “A Ambev fecha longe da máxima de alta” retornaram resultados incorretos. [Link] [12],
conseguiu uma média de 52,3 % de acertos em 78216 artigos com análise de sentimentos e
opinições, variando de 48,1 % a 54,8 %. A decisão de investimento é do investidor e não é
possível realizar a predição com certezas de acertos. O sistema cumpriu o objetivo de realizar
predições próximas do valor real. Apesar deste artigo apresentar a pesquisa utilizando apenas
uma empresa, esse estudo pode ser aplicado a outras empresas integrantes da bolsa de valores
ou até mesmo em outros segmentos.
6. Referências

[1] R. Sandhya ., S. Sonali ., K. Siddhant., B. Deepti., Experiments on Content Based Image


Classification using Color Feature Extraction. Communication, Information & Computing
Technology (ICCICT), IEEE International Conference. Mumbai. 2015. p.1-6
[2] A. Shihavuddin., S. M., Prediction of Stock Price analyzing the online financial news using
Naive Bayes classifier and local economic trends. Advanced Computer Theory and
Engineering, Volume:4. 3rd International Conference, Chengdu. 2010. p.V4-22-V4-26
[3] A. Ara, Redes Bayesianas: Uma Introdução Aplicada a Credit Scoring. Centro de Ciências
Exatas e Tecnológicas CCET. São Carlos. 2010. p.11
[4] C. Leung C. K., F. Jiang., A Data Science Solution for Mining Interesting Patterns from
Uncertain Big Data. IEEE Fourth International Conference on Big Data and Cloud
Computing, Sydney, NSW 2014. p.3-5
[5] V. Poonam., G. Vishal., Big Data Analytics Techniques: A Survey. International Conference
on Green Computing and Internet of Things (ICGCIoT) India 2015. p. 269
[6] X. Brian, A. Sathish K., Big Data Analytics Framework for System HealthMonitoring.
IEEE International Congress on Big [Link] 2015. p.408
[7] Apache Hadoop. Consulta a homepage oficial. Disponível em: <[Link]
[8] B. Graham. O investidor inteligente. Rio de Janeiro, Nova Fronteira, 2015. p.32
[9] Chiavenato I., Introdução à Teoria Geral da Administração. Terceira Edição, SP, 1983.
[10] F. Mattar, N. Pesquisa de Marketing. São Paulo, Atlas, 1994.
[11] F. Ghofrani., A. Haddad K., Jamshidi A. Internet Traffic Classification Using Multiple
Classifiers. IEEE 7th Intern. Confer. on Information and Knowledge Technology. 2015.p.1-5
[12] Y. Kim, S. Jeong R, I. Ghani, Text Opinion Mining to Analyze News for Stock Market
Prediction. Int. J. Advance. Soft Comput. Appl., Vol. 6, No. 1, March 2014. Appl., Vol. 6.

Você também pode gostar