0% encontró este documento útil (0 votos)
47 vistas12 páginas

Análisis del Discurso en Twitter

Cargado por

Luis Jara
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
47 vistas12 páginas

Análisis del Discurso en Twitter

Cargado por

Luis Jara
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

See discussions, stats, and author profiles for this publication at: [Link]

net/publication/288829742

Análisis del discurso en redes sociales: Twitter un caso bajo estudio

Conference Paper · April 2010

CITATION READS

1 6,010

2 authors, including:

Irina Argüelles
Universidad Politécnica de Madrid
59 PUBLICATIONS   124 CITATIONS   

SEE PROFILE

Some of the authors of this publication are also working on these related projects:

Creación del Aula Multicultural: Espacio de Lengua y Cultura Aplicada View project

Redes Sociales para Investigadores y Docentes "ReSIDo" (MOOC) View project

All content following this page was uploaded by Irina Argüelles on 31 December 2015.

The user has requested enhancement of the downloaded file.


ANÁLISIS DE DISCURSO EN REDES SOCIALES. TWITTER
UN CASO BAJO ESTUDIO

ALFONSO MUÑOZ MUÑOZ


IRINA ARGÜELLES ÁLVAREZ
Universidad Politécnica de Madrid

RESUMEN
En este trabajo se analiza el lenguaje utilizado en la red de
microblogging Twitter extrayendo medidas y conclusiones sobre el uso de la
lengua española en estas nuevas formas de comunicación. La investigación
se apoya en la construcción de un corpus de conversaciones Twitter basado
en la selección de 103 usuarios de España. Este corpus está constituido de
319.381 frases, 4.027.746 palabras. Los “textos-Twitter” recopilados se
analizan estadísticamente, se buscan estructuras lingüísticas, patrones de
uso, colocaciones, etc. Se realiza una primera aproximación a la detección
automática de errores tipográficos y ortográficos en este tipo de red social.

Palabras clave: corpus Twitter, análisis del discurso, detección ortográfica.

ABSTRACT
This article aims to analyze the language used in the Twitter network
microblogging, and draws some initial conclusions about the measures and
use of Spanish language in these new forms of communication. The work is
based on the construction of a twitter conversation corpus which includes a
selection of 103 users in Spain. The corpus consists of 319.381 phrases and
4.027.746 words. The “twitter texts” collected are analyzed statistically, and
language patterns, usage patterns, collocations, etc. are also described. A
first aproximation to the authomatic detection of typographical errors and
misspellings is also included to measure the former in this type of social
network in Spanish.

Keywords: Twitter corpus, discourse analysis, spelling

BUENO ALONSO, Jorge L., Dolores GONZÁLEZ ÁLVAREZ, Úrsula KIRSTEN TORRADO, Ana E. MARTÍNEZ
INSUA, Javier PÉREZ GUERRA, Esperanza RAMA MARTÍNEZ & Rosalía RODRÍGUEZ VÁZQUEZ (Eds).
2010: Analizar datos > Describir variación / Analysing data > Describing variation. Vigo: Universidade
de Vigo (Servizo de Publicacións), 710-720
1. INTRODUCCIÓN. REDES SOCIALES

La última década ha sido testigo de una nueva revolución


informativa y colaborativa apoyada en la informática y las
telecomunicaciones, quizás hoy día la Web 2.0/3.0 sea el canalizador
de toda esta revolución. El concepto Web 2.0 fue acuñado por
O’Reilly Media en 2004 para referirse a una segunda generación Web
basada en comunidades de usuarios y una gama especial de servicios,
como las redes sociales, los blogs, los wikis o las folcsonomías, que
fomentan la colaboración y el intercambio ágil de información entre
usuarios. Hoy día las redes sociales forman cada vez más parte de
nuestras vidas en muchos casos sin llegar a comprender el potencial
total de estas tecnologías o los peligros, a modo de pérdida de
privacidad, que puede suponer un uso sin control (Hogben 2007).
Una definición aceptable de red social puede verse como un
conjunto bien definido de actores, individuos, grupos, organizaciones,
sociedades globales, etc., que están vinculados unos a otros a través de
un conjunto de relaciones sociales, simplificadas, en el caso
informático, por el uso de las nuevas tecnologías (Boyd y Ellison
2007). Su estudio y definición ha implicado en las últimas décadas
antropólogos, psicólogos, sociólogos y matemáticos, concretamente
en el intento de su definición utilizando teoría de grafos. Estudios que
reflejan una realidad social centrada en las relaciones entre individuos
y no en las características de los mismos, de hecho una red social
puede ser descrita en función de la eficacia en mezclar 3 ámbitos (las
3C): comunicación (poner en común conocimientos), comunidad
(encontrar e integrar comunidades) y cooperación (hacer cosas
juntos). Existen cientos de redes sociales de propósitos muy dispares.
Su aspecto más positivo es la facilidad para intercambiar/distribuir
información de forma flexible y colaborativa, disminuyendo,
dependiendo de la tecnología, el control por parte de empresas o
gobiernos. Algunas de las redes sociales más populares a nivel
mundial son: myspace, facebook, orkut, friendster, bebo, twitter, etc.

711
1.1 Twitter. Una red social bajo estudio

El trabajo que nos ocupa, presenta una primera aproximación al


análisis del lenguaje utilizado en una red social concreta, la red de
microblogging Twitter, con unas características particulares, intentado
extraer medidas y conclusiones sobre el uso de la lengua española en
estas nuevas formas de comunicación. Se selecciona esta red social al
estar basada en comunicaciones breves, que, por su naturaleza, deben
tener unas características propias de este nuevo género.

2. CREACION DEL CORPUS TWITTER EN ESPAÑOL

Para poder analizar el lenguaje y la presencia de estructuras


lingüísticas utilizadas en esta red social se decide la construcción de
un corpus basado en esta red social concreta.
La red Twitter permite enviar mensajes (frases) basados en texto,
denominados “tweets”, de una longitud máxima de 140 caracteres,
que se publican en la página de un usuario de la red twitter. Cada
usuario twitter puede tener un número determinado de “followers”
(seguidores) y “following” (personas a las que sigue) que definen en
cierta forma su popularidad en la red (O' Reilly y Milstein 2009).
La construcción del corpus se basa en los mensajes publicados
por 103 usuarios de España, mensajes que son recopilados mediante
un crawler programado en lenguaje de programación Java. Los
criterios de selección de estos usuarios se establecen según un número
mínimo de seguidores (1000), en torno a este número están los
usuarios más “famosos”, y un número tweets de 3200, que es el
máximo al que se puede acceder por usuario (en algunos usuarios este
número es ligeramente inferior), de forma que el lenguaje que se va a
analizar no sea una jerga propia de un conjunto reducido de usuarios y
sí la expresión de mensajes que desean ser leídos por una mayoría
pero que pueden tener las características o “comodidades” propias del
canal donde se emiten. Aunque es cierto que la temática y la
homogeneidad del corpus es difícil de establecer ya que cada usuario
puede expresar en cada frase lo que desee (aspectos no relacionados

712
necesariamente con frases anteriores) es cierto que la presencia de
mensajes sobre tecnología es común.
El corpus Twitter creado está constituido por 319.381 mensajes
Twitter y un total de 4.027.746 palabras. Para el etiquetado de este
corpus se implementa un programa en lenguaje JAVA que utiliza el
etiquetador TreeTagger (Schmid 2009) considerando un mensaje
Twitter como una frase. Aunque para algunas mediciones lingüísticas
en este corpus deben considerarse las limitaciones o imprecisiones de
este etiquetador, las medidas sí sirven como una primera
aproximación a este tipo de estructuras lingüísticas en redes sociales.

3. ANALISIS DE DISCURSO EN CONVERSACIONES TWITTER

3.1 Categorías lingüísticas. Datos

El corpus recopilado tiene 4.027.746 palabras, 319.381 frases y


un número total de caracteres de 21.519.161. A partir de estos datos se
extraen las siguientes medidas mostradas en la Tabla1.

Nº palabras/frase 12,61
Nº caracteres/palabra 5,34
Nº caracteres por frase 67,37
Tabla1. Cálculos medios de palabras y caracteres por frase en el corpus bajo estudio.

Nos interesan estas medidas de longitud de frases y palabras


porque, como veremos más adelante, el medio restringe el número de
caracteres por frase.
Para profundizar mejor en un análisis inicial del lenguaje
utilizado por los usuarios bajo estudio en la red twitter se miden
diferentes categorías lingüísticas y otros datos de interés (Tabla2,
Tabla3 y Tabla4).

PoS Nº total de Ocurrencia (%)


palabras (Nº total palabras 4.027.746)
Nombres 1.284.509 31,8915%
NC 863.141 21,4298%

713
NMEA 2697 0,0669%
NP 417.859 10,3745%
NMON 812 0,0201%
Adj 246.313 6,1154%
Adverbio 111.616 2,7711%
lugar 5140 0,1276%
tiempo 36.713 0,9115%
modo 10.747 0,2668%
cantidad 19.382 0,4812%
Verbo 800.093 19,8645%
infinitivos 137.575
gerundios 12.078
participios 136.249
Emoticones 24370 0,6050%
Direcciones http 94600 2,3487%
Palabra inicio 199.691 4,9578%
arroba
Tabla2. Categorías lingüísticas y datos característicos.

En la Tabla2 las etiquetas NC, NMEA, NP y NMON (etiquetas de


treetagger) significan respectivamente: nombres comunes, nombres de
medida, como por ejemplo, metros o litros, nombres propios y
nombres de meses (enero, febrero, etc).

Patrón Nº total Ocurrencia (%)


(Nº total frases
319.381)
Frases que empiezan con 154.972 48,5246%
mayúscula
Frases que empiezan con @ 123.186 38,5702%
Frases que empiezan con número 2.397 0,7505%
Frases que empiezan con RT 20.205 6,3262%
Frases que empiezan con 33.432 10,4677%
minúscula
Frases que acaban con punto 58.297 18,2531%
Frases que acaban con puntos 29.596 9,2666%

714
suspensivos
Acaban con emoticón 19.841 6,2123%
Acaban con dirección http 74.204 23,2336%
Tabla3. Características de inicio y fin de las frases en el corpus Twitter.

Estructura Nº total 102.179


Punto+espacio+termino
Mayus 91494 89,5428%
Minus 1654 1,6187%
Número 847 0,8289%
Palabra+o+Palabra que empieza 11 ocurrencias
por “o”
Palabra+y+Palabra que empieza 42 ocurrencias
por “i”

Omisión de tildes en: Ocurrencias Nº palabras


palabras 4.027.746
Palabra acabada en “ción” 1544 0,0383%
Palabra acaba en “sión” 674 0,0167%
Adverbio acabado en “mente” 148 0,0036%
Tabla 4. Medición de algunas erratas y faltas de ortografías de fácil computación.

3.2 Análisis de los datos

Los primeros cálculos indican que de media, los usuarios de la red


twitter “consumen” sólo un 48,1214% de la capacidad total permitida
por frase (67,37 caracteres frente a los 140 caracteres máximo-frase)
lo que puede dar una primera idea de la inmediatez del medio y para
comunicaciones muy relacionadas con acciones que tienen lugar en un
momento determinado o a lo largo de un tiempo, aspectos temporales,
que se enfatizan con la utilización de adverbios de tiempo.

(1) Grabando con RNE para Babylon Radio, se emite mañana


sábado a las 15:00...
(2) @OscarMatellanes: Mil perdones. La cena era un plan muy
apetecible, pero tengo un capítulo que quiero terminar entre
hoy y mañana

715
Aunque por el mismo motivo se esperaba encontrar un porcentaje
alto de verbos con respecto a otras categorías, son los nombres las que
más abundan en el texto. Efectivamente, encontramos muchos
comentarios que ni siquiera incorporan verbos (sobreentendidos o
elididos)

(3) Amigos, fútbol, cerveza y palomitas :-)


(4) En vivo en los Encuentros Digitales de El Economista:
[Link]

Los nombres comunes son las categorías que alcanzan más


frecuencia en los textos. Dentro de estos nombres y tras un primer
examen, se distinguen los siguientes por número de aparición: casa
256, días 256 noche 227, clase 187, despacho 79, etc.

(5) Recién llegados a casa, a tiempo para cenar y para CSI...


(6) Hay días que tengo más tráfico inducido desde Twitter y
Facebook que desde Google. Para pensar...
(7) Vaya, pues sí que me ha cundido la tarde/noche... Me voy a
dormir. Ciao!

La rutina (lugares comunes) y el tiempo como confirma el uso


más frecuente de adverbios temporales en comparación con otros, son
dos factores importantes en los comentarios.
Tampoco se confirman hipótesis previas de un posible sobreuso
de gerundios con respecto a otros tiempos que podría derivarse de
mensajes que describen lo que el emisor twitter hace en cada
momento. Al contrario, acciones terminadas (participio) o atemporales
(infinitivo) son mucho más frecuentes.

(8) Cogiendo setas - en esta época, esto solo pasa en Galicia


:-)
(9) Probando twitterfon. Me gusta.
(10) Recién aterrizado en Madrid...
(11) A dormir. Buenas noches!!

716
Existen determinados términos característicos de este corpus
como son las palabras iniciadas por @, direcciones web (http) y
emoticones. En el caso de los mensajes twitter estos términos se
justifican debido al uso de mensajes con la intención de publicar
información breve apuntando o comentando sobre una página web que
se anexa. El uso de emoticones, especialmente al final de las frases,
refleja la forma de expresar sentimientos de forma rápida y con un
reducido número de caracteres en un medio tan inmediato.

(3) @digitalmeteo: saluda a la chica de American Express y al


bot de mi parte :-D
(4) @LuisBlas nah, no vale la pena, era una queja :)

Precisamente esta inmediatez en la comunicación de información


podría tener como consecuencia un lenguaje “menos cuidado”. Desde
un punto de vista lingüístico las redes sociales han tenido mala prensa
porque se argumenta (Racero 2009) que el lenguaje usado en estas
redes, es muy poco formal, con muchas incorrecciones gramaticales y
faltas de ortografía. Entendemos que esta afirmación depende mucho
de la red social a la que nos refiramos y el número de personas a las
que vaya destinada la información que publique un usuario. Dicho de
otra forma, cuanto más famoso sea un usuario será más probable que
la información publicada esté más cuidada desde el punto de vista
formal. Con esta premisa, y en una primera aproximación, se ha
decidido analizar una serie de estructuras que se piensa que por la
inmediatez del medio pueden sufrir incorrecciones gramaticales o
faltas de ortografía.
En primer lugar se observa que el 48,52% de las frases empiezan
con mayúscula, 38% con @ y 6,32% con RT. En las comunicaciones
twitter tanto @ como RT tienen un significado importante. El nombre
de un usuario en twitter se inicia siempre con @ y la palabra RT hace
referencia a un tweet copiado de otro usuario de la red twitter. Por
ejemplo, el usuario @edans puede hacer referencia a un tweet
publicado por el usuario @la_informacion (5).

(5) RT @la_informacion: Lo que la industria musical no quiere


que sepas [Link]

717
En segundo lugar, se observa que sólo el 18,25% de las frases
acaban en punto (siendo el 50,76% de las anteriores acabadas en
puntos suspensivos), mientras que la presencia al final de frase de
emoticones y direcciones web puede entenderse como significativa,
característica, muy relacionada con las redes sociales y con la
inmediatez que ofrecen ambos para expresar el ánimo y compartir
información.
En tercer lugar, es viable medir algunas estructuras de forma
precisa como es la presencia de una mayúscula después de un punto y
el uso gramatical correcto en ciertas estructuras, condiciones que
podrían modificarse al escribir mensaje de forma rápida. El 89% de
las palabras después de punto empieza por mayúscula luego, en
principio y a falta de futuras comparaciones, no es éste un problema
ortográfico muy acusado. Por otro lado estructuras como
“palabra”+o+”palabra que empieza por o” o “palabra”+y+”palabra
que empieza por i” son residuales en todo el corpus (6) y (7).

(6) En la presentación del libro Los Sanfermines de Nuestra Vida,


gran trabajo de mis amigos Jesus Rubio y ignacio Murillo
(7) nos estamos autogestionando las colas para la acreditación,
no hay nadie informando o organizando, un desastre

En cuarto lugar, se mide la presencia de ciertas faltas


ortográficas, en concreto palabras en las que se omite la tilde. Era
presumible que medios de comunicación como twitter u otros basados
en la rápida transmisión de información no cuidara especialmente el
uso de la tilde. Para evitar problemas en la identificación automática
de faltas de ortografía en esta primera aproximación se seleccionan las
siguientes estructuras: nombres deverbales—palabras terminadas en
_cion y palabras terminadas en _sion—y adverbios acabados en
_mente acentuados. Aunque es cierto que la aparición de faltas de
ortografía tendrá que ser comparada con otros medios para extraer
conclusiones sobre si proliferan más en este tipo de comunicación, la
omisión de tilde no parece ser tan significativa como se puede
presuponer en este tipo de redes, esto puede deberse a las
características y la popularidad de un usuario en una red social, ya que

718
es asumible que cuanto más popular sea, cuidará más su forma de
expresarse.

4. CONCLUSIONES

Este trabajo aporta un corpus basado en comunicaciones Twitter,


útil para el análisis inicial que se ha presentado y para estudios
posteriores del uso de la lengua española en esta red social. El análisis
de la red twitter indica, en una primera aproximación, que los
mensajes son más breves de lo necesario dadas las restricciones del
medio, que puede explicarse por la inmediatez de la comunicación,
por un lado, y porque aparecen mensajes con mucha presencia de
direcciones web que enlazan más información. Esas mismas
direcciones web son el tema central de muchas de las comunicaciones
de lo que se desprende el interés de los usuarios twitter por comentar y
expresar reacciones acerca de informaciones publicadas típicamente
en páginas web.
La red twitter tiene una nomenclatura interna que parece
caracterizar también este tipo de textos—no queremos en este punto
aventurar conclusiones sobre si twitter es un género—que hace que
palabras que empiecen con @ y RT tengan una presencia notable en
este corpus.
Aunque se entiende que las redes sociales son medios informales
en los que se presupone la presencia de incorrecciones gramaticales y
faltas de ortografía, las mediciones que se han realizado para este
estudio no parecen apuntar en esta dirección. Este resultado, para las
medidas realizadas, puede deberse a que los usuarios seleccionados
tienen cierta popularidad entre sus seguidores lo que puede hacer que
cuiden más los aspectos formales de sus “mensajes”, por otro lado,
analizar usuarios sin repercusión en la red twitter podría tener el
problema de analizar jergas propias de un número reducido de
usuarios que no permitirían obtener conclusiones más o menos
generales de qué parámetros son más característicos en la red twitter.
Por motivos de espacio, en este trabajo se presenta el corpus
desde una perspectiva descriptiva, sin conclusiones acerca de los
resultados en comparación con otros tipos de textos. Actualmente se

719
trabaja en la comparación de estos resultados con otros medios
tecnológicos (blogs y foros) y otros corpora existentes.

REFERENCIAS BIBLIOGRÁFICAS

Boyd, D., Ellison, N., 2007. Social Network Sites: Definition, history
and scholarship. University of California-Berkeley. Journal of
Computer-Mediated Communication, 13(1), article 11 (2007).
Available:[Link]
ml
Hogben, G., 2007. ENISA Position Paper No.1. Security Issues and
Recommendations for Online Social Networks. October 2007.
European Network and information security agency.
Available:[Link]
sa_pp_social_networks.pdf
O’Reilly, Tim., Milstein, Sarah., 2009. The twitter book. O'Reilly.
Isbn: 978-0-596-80281-3. June 2009

Schmid, H., 2009. TreeTagger - a language independent part-of-


speech tagger. Institute for Computational Linguistics of the
University of Stuttgart. Available: [Link]
[Link]/projekte/corplex/TreeTagger/
Racero, L., 2009. La lengua y la ortografía. 31 Diciembre 2009.
[Link]
ortografia/

720

View publication stats

También podría gustarte