Detección de Fake News en Redes Sociales
Detección de Fake News en Redes Sociales
net/publication/349120690
CITATIONS READS
0 304
3 authors, including:
Some of the authors of this publication are also working on these related projects:
All content following this page was uploaded by Juan A. Holgado-Terriza on 14 March 2021.
1
Pontificia Universidad Católica del Ecuador, Esmeraldas, Ecuador.
2
Universidad de Granada, Granada, España.
Pages: 632-645
Resumen: Las redes sociales han cambiado la forma en que la sociedad se informa.
Redes sociales como Twitter y Facebook cuentan con millones de usuarios quienes
muchas veces comparten noticias falsas (fake news) sin saberlo. Los contenidos
de estas noticias son falsos y no verificados, y llegan a viralizarse, engañando
y causando pánico. El objetivo de este estudio es desarrollar una revisión de la
literatura en la que se determina cómo el aprendizaje automático y aprendizaje
profundo, han apoyado para el desarrollo de clasificadores de noticias falsas en
redes sociales. El estudio fue desarrollado a partir de una metodología formal
usada en ciencias de la Computación. Los resultados mostraron que los modelos
de aprendizaje han sido ampliamente usados para crear sistemas de detección de
noticias falsas, predominando la detección en el ámbito político, sociedad, salud y
desastres naturales. Se constató que se emplearon mayoritariamente los modelos de
aprendizaje automático en comparación con los de aprendizaje profundo, aun así,
ambos enfoques demostraron ser eficientes para clasificar noticias falsas, jugando
un determinante de los resultados, el set de datos y el método de extracción de
características empleado.
Palabras-clave: Aprendizaje automático, aprendizaje profundo, noticias falsas,
clasificador.
Abstract: Social networks have changed how society is informed. Social networks
such as Twitter and Facebook have millions of users who often share fake news
without knowing it. The contents of these news are false and unchecked, and they
become viral, deceiving, and causing panic. The objective of this study is to develop
a literature review that examines how machine and deep learning have supported
the development of social media fake news classifiers. The study was developed
from a formal methodology used in computer science. The results showed that
learning models have been widely used to create false news detection systems, with
detection predominating in the political field. It was found that machine learning
models were mostly used in contrast with deep learning models, however, both
approaches demonstrated be efficient to classify fake news, playing a decisive factor
of the results, the data set and the feature extraction method used.
Keywords: Machine learning, deep learning, fake news, classifier.
1. Introducción
En la actualidad, las redes sociales se han vuelto una de las tecnologías más populares
a nivel mundial. Por su fácil acceso y estar orientadas al intercambio de información,
millones de usuarios tienen un perfil en redes sociales como Facebook y Twitter.
Además de que las redes sociales permiten a las personas comunicarse con sus amigos
y familiares a nivel mundial, les ayudan a mantenerse informados de los sucesos que
acontecen en su entorno. A raíz de este uso que la sociedad les ha dado a las redes
sociales, han proliferado muchas publicaciones de noticias que no están contrastadas o
validadas, originándose así, el concepto de noticias falsas, conocidas también como fake
news (Dong-Ho Lee, et al., 2019).
Las noticias falsas, son artículos que tienen contenido informativo, que en lugar de
informar, desinforman a los cibernautas en redes sociales (Allcott & Gentzkow, 2017).
La información publicada y compartida por medio de redes sociales como Twitter y
Facebook tiene la particularidad de que llega a muchos países. Esto implica que una
noticia falsa se difunde rápidamente e incluso puede llegarse a viralizar, causando
pánico en la sociedad. En los últimos años se han difundido cientos de noticias falsas,
en distintos ámbitos, entre los que figuran los siguientes: política, deportes, economía,
ciencia, entretenimiento, entre otros.
En el ámbito político, se han originado varios casos de noticias falsas en redes sociales
que han tenido un impacto mundial. Un caso muy popular fue en las elecciones de
Estados Unidos en 2016. En (Allcott & Gentzkow, 2017) se analizaron las publicaciones
en las redes sociales en el entorno de las elecciones presidenciales de Estados Unidos.
En este panorama, se contabilizaron 115 noticias falsas relacionadas con Donal Trump.
Asimismo, en torno a la otra candidata a la presidencia, Hillary Clinton, se compartieron
41 noticias falsas en Facebook. Otro caso relevante, en el ámbito financiero fue el de
United Airlines, que, con la subida de un artículo falso a Internet, provocó que el precio
de sus acciones cayera. El impacto que tuvo esta noticia falsa fue grave y su efecto
persistió por un tiempo antes de volver a recuperarse (Carvalho et al., 2011). Otro caso,
también con cierta repercusión, fue la noticia que ha sido compartida en las diferentes
plataformas refiriéndose al dióxido de cloro. Según el contenido de la noticia falsa, este
químico era la cura contra el covid-19 y a raíz de ello, muchas personas tomaron la
decisión de comprarlo y consumirlo, sin saber las consecuencias que este químico puede
provocar si se administra sin la supervisión de un médico (Huang & Carley, 2020).
Los casos descritos anteriormente son solo algunos ejemplos de noticia falsas de los
últimos años. Esto ha llamado la atención de los investigadores para crear herramientas
orientadas a detectar noticias falsas en redes sociales y en Internet en general. En este
sentido, se ha empleado la Inteligencia Artificial (IA), y específicamente las técnicas
de aprendizaje automático. Puntualmente, para crear sistemas predictivos que sean
capaces de clasificar noticias falsas en las redes sociales se han planteado métodos de
minería de texto. Estos sistemas emplean como un componente principal, un modelo de
aprendizaje basado en datos, el cual es entrenado a partir de tweets, posts of cometido
web descargados de las redes sociales, micro blogs o webs. Sin embargo, existen
muchos modelos y no se conoce de manera formal cuáles son las características de los
clasificadores especializados y publicados en la literatura. Algoritmos de aprendizaje
automático, conocidos también como aprendizaje de máquina (i.e., árboles de decisión,
bosques aleatorios, Naïve Bayes, máquina de vectores de soporte), han sido aplicados
con éxito (Gilda, 2018; Lakshmanarao et al., 2019). Asimismo, modelos de aprendizaje
profundo (i.e., redes convolucionales, con memoria, recurrentes) han sido empleados
de manera independiente o fusionados con redes neuronales profundas (Kresnakova et
al., 2019). Es así, como se han originado muchos modelos para clasificar noticias falsas
en redes sociales.
El objetivo de este estudio es investigar cuáles han sido los principales modelos
de IA que se han propuesto en la literatura para detectar noticias falsas en redes
sociales. Para ello, se plantea el desarrollo de una revisión de la literatura basada
en una metodología formal, como es la metodología de (Kitchenham & Charters,
2007), ampliamente usada para el desarrollo de este tipo de estudios en las ciencias
computacionales. Los resultados de este estudio permitirán describir experiencias
de investigadores y nivel de exactitud alcanzado por los sistemas de detección
automática de noticias falsas implementados a partir de minería de textos y modelos
de aprendizaje automático.
El documento está organizado de la siguiente manera. La Sección 2, describe la
metodología empleada para llevar a cabo el proceso de revisión sistemática de la
literatura, enfatizando en la estrategia de búsqueda diseñada. La Sección 3 presenta los
resultados, esto es, se responde de manera detallada a cada una de las preguntas de
investigación (PIs) formuladas en base al análisis de los estudios primarios recuperados.
También, se discuten brevemente dichos resultados. Finalmente, en la Sección 4 se
describen las conclusiones.
2. Metodología
Una revisión sistemática de la literatura consiste en identificar, evaluar e interpretar
los estudios más relevantes de un tema en particular. Para llevar a cabo el proceso de
revisión sistemática planteado en este estudio, se empleó la metodología propuesta por
(Kitchenham & Charters, 2007), la cual es una metodología formal para la ejecución de
trabajos de esta naturaleza en las ciencias computacionales.
Artículos excluidos
Registro después de remover los duplicados (n=55)
(n=15)
Los datos muestran que el uso de la IA aplicada para la detección de noticias falsas
se ha venido trabajando ampliamente en los últimos años; mayoritariamente, las
propuestas analizadas se publicaron en 2019 (26 estudios), muchas de las cuales fueron
desarrolladas por investigadores de la India (12 estudios). Esto se debe a que en ese país
en 2019 se está trabajando en una fuerte campaña para palear las noticias falsas. Por
tanto, la academia está jugando un papel importante para resolver este problema, que,
en términos de política, ha causado desestabilización.
PI2: ¿Cuál es el alcance que han tenido los modelos de aprendizaje, en
términos de exactitud, para detectar noticias falsas en medios sociales?
Modelos de aprendizaje automático para detectar noticias falsas. Los resultados
obtenidos mostraron que muchos de los algoritmos de clasificación empleados en
aprendizaje automático han sido experimentados para entrenar modelos de detección
de noticias falsas. En la Tabla 2, es posible ver que mayoritariamente se aplicaron los
algoritmos relacionados con las máquinas de vectores de soporte (16 estudios), seguido
de la regresión logística (9 estudios) y a la par los algoritmos basados en el Teorema de
Bayes, bosques aleatorios y árboles de decisión con 7, 7 y 6 estudios respectivamente.
Otros algoritmos aplicados, aunque con menor frecuencia fue el algoritmo de vecinos
más cercanos y algoritmos menos populares como el de potenciación del gradiente y
descenso estocástico de gradiente. Sin embargo, los algoritmos que alcanzaron mejor
exactitud (accuracy) para detectar noticias falsas fueron: las máquinas de vectores de
soporte con 99,90%, regresión logística con 91,60% y el algoritmo de potenciación de
gradiente con el 91,05%.
Tabla 2 – Uso de los modelos de aprendizaje automático en los estudios analizados. NB=Naïve
Bayes, DT=árbol de decisión, RF=bosque aleatorio, KNN=vecinos más cercanos, SVM=vectores
de soporte, LR=Regresión logística, GB=potenciación de gradiente, AUC-ROC=área bajo la
curva, AB=potenciación adaptativa, SGD=descenso estocástico de gradiente.
Es importante señalar que los porcentajes de exactitud alcanzados por los algoritmos
de aprendizaje automático y aprendizaje profundo es directamente dependiente de los
datos y set de datos empleados para entrenar los modelos; y dependiente también del
método de extracción de características aplicados sobre los datos. En la mayoría de los
estudios se aplicaron métodos como: de frecuencia de término (i.e., S14), frecuencia de
término - frecuencia de documento inversa (TF-IDF) (i.e., S9, S28, S44, S30), vectores
globales (GloVe) (i.e. S9, S16) y el método CountVectorizer (i.e., S9, S16)
PI3: ¿Qué herramientas de software y datos se han usado para crear modelos
predictivos de detección de noticias falsas en redes sociales? En lo relacionado
a las herramientas de desarrollo empleadas para crear clasificadores de noticias falsas
en redes sociales se empleó mayoritariamente la herramienta de programación Python
(18 estudios). Python es actualmente la herramienta más popular y usada para el
desarrollo de sistemas de IA, y específicamente para el desarrollo de los sistemas de
minería de texto, que integran modelos de clasificación automática, se está empleando
este lenguaje de programación. También se ha evidenciado el uso de las librerías de
aprendizaje automático de Python como: sci-kit learn (6 estudios; S2, S5, S14, S16, S44,
S46), Keras (4 estudios; S9, S12, S26, S42) y TensorFlow (4 estudios; S12, S13, S21, S26).
De manera complementaria, también se ha empleado la librería para procesamiento de
lenguaje natural, NLTK, Natural Language Toolkit, por sus siglas en inglés (9 estudios;
S9, S15, S21, S14, S16, S39, S44, S46, S47). En otros estudios se evidenció también el
uso de la herramienta de procesamiento de lenguaje natural de Google (4 estudios; S5,
S8, S26, S27). Asimismo, hubo estudios que no detallaban aspectos de las herramientas
de desarrollo como es el caso de los estudios S8, S10, S11, S18, S30, S33, S35, S24 y S20
haciendo que no se puedan replicar los experimentos en algunos casos.
En lo que respecta a los datos usados por las propuestas analizadas, éstas emplearon
principalmente set de datos accesibles de forma pública en repositorios como: Kaggle (9
estudios; S12, S13, S8, S10, S20, S22, S30, S39, S46), GitHub (1 estudio; S17) y PolitiFact
(4 estudios; S11, S16, S2, S32, S46). Se evidenció también que algunos estudios emplearon
en menor proporción otras fuentes de datos como: Twitter (S28, S33), The New York
Times y Washington Post (S1), [Link] o BuzzFeed (S27, S46, S11, S27).
Es importante resaltar que en general los modelos aplicaron minería de texto sobre set
de datos previamente especificados. De esta manera, los investigadores optimizaron el
tiempo requerido para realizar la recolección y preprocesamiento de los datos que son
el insumo para aplicar el proceso de minería de textos y llevar a cabo el proceso de
entrenamiento del clasificador aplicando los algoritmos de aprendizaje supervisado,
aprendizaje en el que se conocen las etiquetas de salida en el set de datos de entrenamiento.
Asimismo, parte de los datos que conformaban el set de datos fueron empleados para
llevar a cabo la fase de pruebas de los modelos. No obstante, en algunas propuestas, los
investigadores crearon sus propios sets de datos para desarrollar sus modelos predictivos
de clasificación de noticias falsas. Usaron como fuente, información de webs y blogs de
noticieros. En resumen, los sets de datos empleados fueron los siguientes: NYT (S5, S9),
LIAR (S16, S42, S32), News (S23), Fake News (S13, S8), Fake News Net (S2), Fake Real
News (S46) y FNC-1 (S15, S17, S24, S35, S45). Otros menos populares también fueron
usados o creados (S26, S19, S28, S20).
PI4: ¿En qué ámbitos se ha detectado noticias falsas en redes sociales?
Cuatro de los ámbitos en los que se han enfocado las propuestas estudiadas, y orientadas
a detectar noticias falsas, fueron las siguientes: política (26 estudios; S5, S8, S10, S11,
S14, S16, S20, S27, S30, S39, S42, S44, S45, S47, S1, S2, S9, S12, S13, S15, S17, S24,
S25, S26, S32, S34), negocios y economía (3 estudios; S5, S25, S34), sociedad, deporte y
cultura (4 estudios; S5, S14, S5, S3), ciencia, tecnología y salud (3 estudios; S5, S14, S5),
entretenimiento (2 estudios; S14, S34) y desastres naturales (S33). Existieron también,
7 estudios en los que no se especificaba el ámbito de las noticias falsas analizadas (S18,
S19, S22, S23, S28, S46, S21). Se evidenció que la mayor cantidad de noticias falsas están
en el ámbito político, esto es, información sobre gobernantes y sus acciones. Es por ello,
que a nivel de nación, los gobiernos tienen interés en palear las noticias falsas, muchas
de las cuales desestabilizan sus gobiernos causando caos entre la población.
4. Conclusiones
Los resultados mostraron que los modelos de aprendizaje de IA han sido ampliamente
empleados para la creación de sistemas de detección automática de noticias falsas. Con
altos y bajos porcentajes de exactitud (accuracy), 22 de los clasificadores analizados
integraron algoritmos basados en: árboles de decisión, teorema de Bayes, regresión
logística, vecinos más cercanos, bosques aleatorios y máquinas de vectores de soporte.
Este último tuvo la mejor medida de precisión, 99,9%. Por otro lado, 23 estudios
restantes emplearon redes neuronales (RN). Las redes convolucionales, redes con
memoria a corto plazo y las redes recurrentes, fueron las más usadas, alcanzando las
redes convolucionales una precisión del 97% y un modelo genérico de red neuronal
un 99,90%. Esto permite concluir que los clasificadores que aplicaron aprendizaje
automático fueron más exactos para clasificar noticias falsas a partir de tweets. Sin
embargo, muchos modelos están optando por combinar tanto el aprendizaje automático
como el aprendizaje profundo para optimizar el proceso en distintas etapas y conseguir
así una mejor medida de exactitud a la hora de detectar noticias falsas.
A pesar de que se han desarrollado una alta gama de modelos predictivos orientados
a clasificar noticias falsas a partir de tweets, es aún un reto integrar estos modelos en
la red social Twitter para advertir a los usuarios previo a compartir contenido. Los
modelos propuestos solo han identificado características principales de los tweets que
incorporan contenido de noticias falsas por lo que existe una brecha entre la detección
de noticias falsas compatibles no solo con la red social Twitter; sino que sea compatible
con cualquier otra de las redes sociales ampliamente usadas como lo es Facebook o blogs
disponibles en Internet.
La difusión de noticias falsas a través de las redes sociales o en la web general causa impacto
negativo a la sociedad de general. Aunque se ha identificado que mayoritariamente, las
noticias falsas que mayormente se difunden son las del ámbito político, económico y
respecto a desastres naturales, es importante ahondar esfuerzos para que aplicando la
IA, y el aprendizaje automático, sea posible también identificar noticias falsas en otros
ámbitos, y que no sean solo en formato texto; sino que cubra el espectro de tipos de
noticias falsas descritas en (Manzoor et al., 2019), tales como: basadas en imágenes, en
usuario, en conocimiento, en estilo y basadas en postura.
Referencias
Abdullah-All-Tanvir, Mahir, E. M., Akhter, S., & Huq, M. R. (2019). Detecting Fake News
using Machine Learning and Deep Learning Algorithms. 2019 7th International
Conference on Smart Computing and Communications, ICSCC 2019, 1–5.
Abedalla, A., Al-Sadi, A., & Abdullah, M. (2019). A closer look at fake news detection: A
deep learning perspective. ACM International Conference Proceeding Series, 24–28.
Ibrishimova, M. D., & Li, K. F. (2020). A machine learning approach to fake news
detection using knowledge verification and natural language processing. Advances
in Intelligent Systems and Computing, 1035, 223–234.
Jain, A., Shakya, A., Khatter, H., & Gupta, A. K. (2019). A smart System for Fake News
Detection Using Machine Learning. IEEE International Conference on Issues and
Challenges in Intelligent Computing Techniques, ICICT 2019, 2–5.
Kaliyar, R. K., Goswami, A., & Narang, P. (2019). Multiclass Fake News Detection using
Ensemble Machine Learning. Proceedings of the 2019 IEEE 9th International
Conference on Advanced Computing, IACC 2019, 103–107.
Kareem, I., & Awan, S. M. (2019). Pakistani Media Fake News Classification using
Machine Learning Classifiers. 3rd International Conference on Innovative
Computing, ICIC 2019, Icic, 1–6.
Katsaros, D., Stavropoulos, G., & Bridge, I. (2019). Which machine learning paradigm
for fake news detection ? 383–387.
Kitchenham, B., & Charters, S. (2007). Guidelines for performing systematic literature
reviews in software engineering.
Kong, S. H., Tan, L. M., Gan, K. H., & Samsudin, N. H. (2020). Fake News Detection using
Deep Learning. ISCAIE 2020 - IEEE 10th Symposium on Computer Applications
and Industrial Electronics, Ml, 102–107.
Kresnakova, V. M., Sarnovsky, M., & Butka, P. (2019). Deep learning methods for Fake
News detection. IEEE Joint 19th International Symposium on Computational
Intelligence and Informatics and 7th International Conference on Recent
Achievements in Mechatronics, Automation, Computer Sciences and Robotics,
CINTI-MACRo 2019 - Proceedings, 143–148.
Kumar, A., Singh, S., & Kaur, G. (2019). Fake news detection of Indian and United
States election data using machine learning algorithm. International Journal of
Innovative Technology and Exploring Engineering, 8(11), 1559–1563.
Kumar, S., Asthana, R., Upadhyay, S., Upreti, N., & Akbar, M. (2020). Fake news
detection using deep learning models: A novel approach. Transactions on Emerging
Telecommunications Technologies, 31(2), 1–23.
Lakshmanarao, A., Swathi, Y., & Srinivasa Ravi Kiran, T. (2019). An effecient fake news
detection system using machine learning. International Journal of Innovative
Technology and Exploring Engineering, 8(10), 3125–3129.
Liu, H. (2019). A Location Independent Machine Learning Approach for Early Fake
News Detection. 2019 IEEE International Conference on Big Data (Big Data),
4740–4746.
Manzoor, S. I., Singla, J., & Nikita. (2019). Fake news detection using machine learning
approaches: A systematic review. Proceedings of the International Conference on
Trends in Electronics and Informatics, ICOEI 2019, Icoei, 230–234.
Masood, R., & Aker, A. (2018). The fake news challenge: Stance detection using
traditional machine learning approaches. IC3K 2018 - Proceedings of the 10th
International Joint Conference on Knowledge Discovery, Knowledge Engineering
and Knowledge Management, 3(Kmis), 128–135.
Mokhtar, M. S., Jusoh, Y. Y., Admodisastro, N., Pa, N., & Amruddin, A. Y. (2019).
Fakebuster: Fake news detection system using logistic regression technique in
machine learning. International Journal of Engineering and Advanced Technology,
9(1), 2407–2410.
Poddar, K., Amali, G. B. D., & Umadevi, K. S. (2019). Comparison of Various Machine
Learning Models for Accurate Detection of Fake News. 2019 Innovations in Power
and Advanced Computing Technologies, i-PACT 2019, 1–5.
Qawasmeh, E., Tawalbeh, M., & Abdullah, M. (2019). Automatic Identification of Fake
News Using Deep Learning. 2019 6th International Conference on Social Networks
Analysis, Management and Security, SNAMS 2019, 383–388.
Reis, J. C. S., Correia, A., Murai, F., Veloso, A., & Benevenuto, F. (2019). Explainable
machine learning for fake news detection. WebSci 2019 - Proceedings of the 11th
ACM Conference on Web Science, 17–26.
Sherry Girgis, Eslam Amer, M. G. (2018). Deep Learning Algorithms for Detecting Fake
News in Online Text. 2018 13th International Conference on Computer Engineering
and Systems (ICCES), 93–97.
Singh, R., Chun, S. A., & Atluri, V. (2020). Developing Machine Learning Models to
Automate News Classification. The 21st Annual International Conference on
Digital Government Research, 354–355.
Supanya Aphinwongsophon, P. C. (2018). Detecting Fake nes with Machine Learning
Method. 528–531.
Tanik Saikh, Amit Anand, AsifEkbal, and P. B. (2019). A Novel Approach Towards Fake
News Detection: Deep Learning Augmented with Textual Entailment Features. In
Nldb 2019 (Vol. 1, Issue Table 1). Springer International Publishing.
Verma, A., Mittal, V., & Dawn, S. (2019). FIND: Fake Information and News Detections
using Deep Learning. 2019 12th International Conference on Contemporary
Computing, IC3 2019, 1–7.
Ye-Chan Ahn, C.-S. J. (2019). Natural Language Contents Evaluation System for Detecting
Fake News using Deep Learning. 2019 16th International Joint Conference on
Computer Science and Software Engineering (JCSSE), February, 1–9.