Estadística
La Estadística se ocupa de la recolección, agrupación, presentación, análisis e
interpretación de datos. A menudo se llaman estadísticas a las listas de estos datos, cosa
que crea una cierta ambigüedad, que no debería originarnos confusiones. La Estadística
no son sólo los resultados de encuestas, ni el cálculo de unos porcentajes, la Estadística es
un método científico que pretende sacar conclusiones a partir de unas observaciones
hechas.
La Estadística para su mejor estudio se ha dividido en dos grandes ramas: la Estadística
Descriptiva y la Inferencial.
Descriptiva Realiza el estudio sobre la población completa, observando una característica
de la misma y calculando unos parámetros que den información global de
toda la población
Inferencial Realiza el estudio descriptivo sobre un subconjunto de la población llamado
muestra y, posteriormente, extiende los resultados obtenidos a toda la
población.
Muestra: Es un subconjunto de la población al que tenemos acceso y sobre el que
realmente se hacen las observaciones
Población: Es el conjunto de elementos, individuos o entes sujetos a estudio y de los cuales
queremos obtener un resultado.
Población finita: cuando el número de elementos que la forman es finito, por
ejemplo el número de alumnos de un centro de enseñanza, o grupo clase.
Población infinita: cuando el número de elementos que la forman es infinito, o
tan grande que pudiesen considerarse infinitos
Al hacer un estudio de una determinada población, observamos una característica o propiedad de
sus elementos o individuos. Cada una de estas características estudiadas se llama variable
estadística.
Variable cualitativa: Es aquella característica que no podemos expresar con
números y hay que expresarla con palabras. Por ejemplo, el lugar de residencia, comida
favorita, profesión que te gusta
Ordenable Aquellas que sugieren una ordenación, por ejemplo la
graduación militar, El nivel de estudios, etc
No ordenable Aquellas que sólo admiten una mera ordenación alfabética,
pero no establece orden por su naturaleza, por ejemplo el
color de pelo, sexo, estado civil, etc
Variable cuantitativa: Es cualquier característica que se puede expresar con
números. Por ejemplo, el número de hermanos, la estatura, etc.
Variable Es aquella variable que puede tomar únicamente un número
cuantitativa finito de valores. Por ejemplo, el número de hermanos
discreta
Variable Es aquella variable que puede tomar cualquier valor dentro de un
cuantitativa intervalo real. Por ejemplo, la estatura.
continua
Representación gráfica de los datos y su interpretación.
En los análisis estadísticos, es frecuente utilizar representaciones visuales complementarias de las
tablas que resumen los datos de estudio. Con estas representaciones, adaptadas en cada caso a la
finalidad informativa que se persigue, se transmiten los resultados de los análisis de forma rápida,
directa y comprensible para un conjunto amplio de personas.
Diagramas de barras Se usan para representar gráficamente series estadísticas de valores en un
sistema de ejes cartesianos, de manera que en las abscisas se indica el
valor de la variable estadística y en las ordenadas se señala su frecuencia
absoluta.
Estos gráficos se usan en representación de caracteres cualitativos y
cuantitativos discretos.
Histogramas En variables cuantitativas continuas, se emplea una variante del diagrama
de barras llamada histograma.
Polígonos de Se trazan las frecuencias absolutas o relativas de los valores de la variable
frecuencias y se unen los puntos resultantes mediante trazos rectos. Con ello se
obtiene una forma de línea poligonal abierta.
Los polígonos de frecuencias se utilizan preferentemente en la
presentación de caracteres cuantitativos, y tienen especial interés cuando
se indican frecuencias acumulativas. Se usan en la expresión de
fenómenos que varían con el tiempo, como la densidad de población, el
precio o la temperatura
Gráfica de sectores En los diagramas de sectores, también llamados circulares o de tarta, se
muestra el valor de la frecuencia de la variable señalada como un sector
circular dentro de un círculo completo. Por ello, resultan útiles
particularmente para mostrar comparaciones entre datos, sobre todo en
forma de frecuencias relativas de las variables expresadas en forma de
porcentaje
Pictograma Muestran diagramas figurativos con figuras o motivos que aluden a la
distribución estadística analizada (por ejemplo, una imagen
antropomórfica para indicar tamaños, alturas u otros).
Cartograma Basados en mapas geográficos que utilizan distintas tramas, colores o
intensidades para remarcar las diferencias entre los datos.
Pirámide de Se utilizan en la expresión de informaciones demográficas, económicas o
población sociales, y en ellas se clasifican comúnmente los datos de la población del
grupo de muestra considerado en diferentes escalas de edad y
diferenciada por sexo.
Tendencia central
Son indicadores estadísticos que muestran hacia qué valor (o valores) se agrupan los datos.
Esta primera parte la dedicaremos a analizar tres medidas de tendencia central:
La media aritmética
La moda
La mediana
Media aritmética: Equivale al cálculo del promedio simple de un conjunto de datos. Para
diferenciar datos muestrales de datos poblacionales, la media aritmética se representa con un
símbolo para cada uno de ellos: si trabajamos con la población, este indicador será µ; en el caso de
que estemos trabajando con una muestra, el símbolo será X.
Se obtiene al dividir la sumatoria de un conjunto de datos sobre el número total de datos. Solo es
aplicable para el tratamiento de datos cuantitativos.
Mediana: Valor que divide una serie de datos en dos partes iguales. La cantidad de datos que
queda por debajo y por arriba de la mediana son iguales
La definición de geométrica se refiere al punto que divide en dos partes a un segmento. Por
ejemplo, la mediana del segmento AB es el punto C.
La mediana es 3, dejando 5 datos a cada lado. Me = 3
El punto medio se encuentra entre dos valores: 2 y 3, por tanto, el valor de la mediana será 2,5.
Moda: indica el valor que más se repite, o la clase que posee mayor frecuencia.
En el caso de que dos valores presenten la misma frecuencia, decimos que existe un conjunto de
datos bimodal. Para más de dos modas hablaremos de un conjunto de datos multimodal.
Medidas de dispersión
Se encargan de estudiar el comportamiento de todos los datos y cómo se distribuyen alrededor de
un valor central, la media aritmética. Dentro de las medidas de dispersión se encuentran: el rango,
la desviación media, la desviación estándar y la varianza
Rango: Es la variación o diferencia entre el dato mayor y el dato menor de un conjunto de datos.
Con sólo identificar el valor mayor y el menor, es posible calcular el rango
Desviación media: es el promedio de las distancias (o diferencias) entre todas las observaciones y
la media aritmética. Se usa para medir la variabilidad de un conjunto de datos y se calcula
mediante la siguiente ecuación:
Muestra: Población
Varianza: puede considerarse como el promedio de los cuadrados de las diferencias entre cada
dato y la media aritmética del conjunto. La varianza se representa con el símbolo s2
Desviación estándar: es la medida de dispersión más frecuente por ser la más práctica. La
desviación estándar, por definición, es la raíz cuadrada de la varianza de tal manera que si se
conoce ésta, para calcular la desviación, simplemente se le extrae raíz a la varianza.
Medidas de posición
Equivalen a los valores que puede tomar una variable caracterizados por agrupar a cierto
porcentaje de observaciones en la muestra o población.
Las medidas de posición son ideales para obtener información adicional a partir de datos
resumidos, es decir, que presentan perdida de información por agrupamiento en intervalos de
clase.
Son indicadores estadísticos que muestran la frecuencia acumulada hasta un valor k cualquiera.
Percentiles
Deciles
Cuartiles
Percentiles: Representan los valores de la variable que están por debajo de un porcentaje, el cual
puede ser una valor de 1% a 100% (en otras palabras, el total de los datos es divido en 100 partes
iguales).
La notación empleada será: Pk
Donde k es equivalente al porcentaje de datos acumulados, y Pk es el valor de la variable que
representa dicho porcentaje. Por ejemplo, P5 es el valor de la variable que deja por debajo el 5%
de los datos. P78 será entonces el valor que agrupa el 78% de los datos.
Deciles: Para los deciles, tomaremos el total de los datos divididos en 10 partes iguales, por tanto,
existirán 10 deciles representado como Dk
D1 = Valor de la variable que agrupa el 10% de los datos.
D2 = Valor de la variable que agrupa el 20% de los datos.
D3 = Valor de la variable que agrupa el 30% de los datos.
D4 = Valor de la variable que agrupa el 40% de los datos.
D5 = Valor de la variable que agrupa el 50% de los datos.
D6 = Valor de la variable que agrupa el 60% de los datos.
D7 = Valor de la variable que agrupa el 70% de los datos.
D8 = Valor de la variable que agrupa el 80% de los datos.
D9 = Valor de la variable que agrupa el 90% de los datos.
D10 = Valor de la variable que agrupa el 100% de los datos.
Cuartiles: Para los cuartiles, tomaremos el total de los datos divididos en 4 partes iguales.
Denotaremos el cuartel como Qk.
Q1 = Valor de la variable que agrupa el 25% de los datos.
Q2 = Valor de la variable que agrupa el 50% de los datos.
Q3 = Valor de la variable que agrupa el 75% de los datos.
Q4 = Valor de la variable que agrupa el 100% de los datos
Medidas de forma
Son aquellos números resúmenes, que indican la morfología de la distribución de los datos, es
decir de la simetría y apuntamiento que tiene el histograma de la variable en estudio. Sólo se
pueden calcular en variables medidas en escala intervalar y de razón
Sesgo (coeficiente de asimetría)
Curtosis
Sesgo (coeficiente de asimetria): El objetivo de la medida de la asimetría es, sin necesidad de
dibujar la distribución de frecuencias, estudiar la deformación horizontal de los valores de la
variable respecto al valor central de la media. Las medidas de forma pretenden estudiar la
concentración de la variable hacia uno de sus extremos.
Una distribución es simétrica cuando a la derecha y a la izquierda de la media existe el mismo
número de valores, equidistantes dos a dos de la media, y además con la misma frecuencia.
Una distribución es Simétrica si x = Me = Mo
En caso contrario, decimos que la distribución es Asimétrica, y entonces puede ser de dos tipos:
Asimétrica a la izquierda. Es el caso en que Mo ≥ Me ≥ x
Asimétrica a la derecha. Es el caso en que Mo ≤ Me ≤ x
Curtosis: El concepto de curtosis o apuntamiento de una distribución surge al comparar la forma
de dicha distribución con la forma de la distribución Normal. De esta forma, clasificaremos las
distribuciones según sean más o menos apuntadas que la distribución Normal.
Una distribución es Mesocúrtica si la distribución de sus datos es la misma que la de la
variable Normal. En ese caso, su coeficiente de curtosis es cero.
La distribución es Leptocúrtica si está más apuntada que la Normal. En ese caso, su
coeficiente de curtosis es positivo.
Si la distribución está menos apuntada que la Normal, entonces es Platicúrtica, y su
coeficiente de Fisher es negativo.
Coeficiente de correlación lineal de Pearson
La covarianza es una medida de la variabilidad común de dos variables (crecimiento de ambas al
tiempo o crecimiento de una y decrecimiento de la otra), pero está afectada por las unidades en
las que cada variable se mide. Así pues, es necesario definir una medida de la relación entre dos
variables, y que no esté afectada por los cambios de unidad de medida. Una forma de conseguir
este objetivo es dividir la covarianza por el producto de las desviaciones típicas de cada variable,
ya que así se obtiene un coeficiente adimensional, r. (denominado coeficiente de correlación lineal
de Pearson)
Propiedades del coeficiente de correlación lineal
Carece de unidades de medida (adimensional).
Es invariante para transformaciones lineales (cambio de origen
y escala) de las variables.
Sólo toma valores comprendidos entre −1 y 1
Cuando |r| esté próximo a uno, se tiene que existe una relación lineal muy fuerte entre las
variables.
Cuando r ≈ 0, puede afirmarse que no existe relación lineal entre ambas variables. Se dice
en este caso que las variables son incorreladas.