Universidad Autónoma de Asunción Representaciones Graficas
DESARROLLO CLASE 1
UNIDAD 1
OBJETIVOS:
1. Conocer los conceptos fundamentales mas utilizados en Estadística.
2. Interpretar informes estadísticos que faciliten la decisión en situaciones de
incertidumbre
DEFINICIÓN DE ESTADÍSTICA
Para iniciar el estudio de la Estadística conviene tener claro su definición.
Aunque hay tantas definiciones de estadística podemos presentar
algunas que aparecen hoy en día como más aceptables.
Para J. Neyman la Estadística “trata de problemas relativos a las
características operatorias de las reglas de comportamiento inductivo
basado en experimentos aleatorios”.
Según Murray R. Spiegel “la Estadística estudia los métodos científicos
para recoger, organizar, resumir y analizar datos, así como para sacar
conclusiones válidas y tomar decisiones razonables basadas en tal
análisis”.
Una visión más amplia de esta asignatura la da William Mendenhall en su
obra Estadística para administradores (1990) “La estadística es un área
de la ciencia que se ocupa del diseño de experimentos o de métodos de
muestreo, del análisis de datos y de obtener inferencias acerca de una
población de mediciones a partir de la información contenida en una
muestra. La Estadística se ocupa del desarrollo y aplicación de
procedimientos para el diseño, el análisis y la realización de inferencias
que darán la mejor información de costo mínimo. Adicionalmente, la
estadística se ocupa de dar una medida cuantitativa acerca de la bondad
del procedimiento de efectuar inferencias”.
Concepto de Estadística
La Estadística es la parte de las Matemáticas que estudia métodos para
interpretar datos obtenidos de investigaciones o experimentos aleatorios
(aquellos en los que no se puede predecir el resultado aunque se realicen
siempre en las mismas condiciones), con el fin de extraer de ellos unas
conclusiones.
Universidad Autónoma de Asunción Representaciones Graficas
Función de la Estadística: Elaborar principios y métodos que nos ayuden a
tomar decisiones frente a la incertidumbre.
La Estadística puede ser:
a) Descriptiva: Trata de obtener unas conclusiones a partir de ciertos datos
mediante el empleo de gráficos o la obtención de unos ciertos valores que los
representen a todos. Esta relacionado con el resumen, organización y
descripción de los Datos.
b) Inferencial: Trata de determinar los valores que adoptarán una serie de
datos muy numerosos, que forman una población mediante el estudio de unos
cuantos de ellos extraídos de la población de una manera significativa y que
forman una muestra. Relacionada con el proceso de utilizar datos para tomar
decisiones en el caso más general del que forman parte estos datos.
Comprende aquellas técnicas por medio de las cuales se toman decisiones
sobre una población, basada en el análisis de una muestra.
APLICACIÓN DE LA ESTADISTICA
La Estadística implica una forma nueva de pensar en término de incertidumbre
o de improbabilidades y ayuda a los investigadores a diseñar experimentos y a
evaluar objetivamente los datos numéricos resultantes. Proporciona
instrumentos para la toma de decisiones cuando prevalecen condiciones de
incertidumbre.
A estadística moderna es una teoría de la información con la inferencia
como su objetivo utilizando un conjunto de mediciones de una población.
El medio para la inferencia es la muestra, la cual es un subconjunto de
mediciones seleccionadas de la población.
Deseamos hacer una inferencia acerca de la población sobre la base de
las características de la muestra o de la información contenida en una
muestra empleando un estimador estadístico (promedio, porcentaje, etc.)
para hacer una inferencia acerca de la población total. La estadística
elemental nos dice que esta estimación se puede hacer tan exacta como
queremos, simplemente al aumentar el tamaño de la muestra. La
estimación puede ser acompañada por un limite para el error de
estimación o bien expresada como un intervalo de confianza.
Por lo tanto podemos decir que la estadística es un campo del estudio
referente a:
1) La Organización y resumen de los Datos (Estadística Descriptiva).
2) La extracción de inferencia o información acerca de un grupo de
datos cuando solo se observan una parte de ella. (Estadística
Inferencial).
Objetivo de la Estadística: El objetivo fundamental de la Estadística es
hacer inferencia acerca de una población con base a la información
Universidad Autónoma de Asunción Representaciones Graficas
contenida en la muestra. El primer paso es encontrar una manera de
expresar una inferencia acerca de una población o describir un conjunto de
mediciones. El segundo paso es considerar la forma en que se puede
hacer la inferencia acerca de la población con base a la información
contenida en la muestra.
Los problemas estadísticos se caracterizan por lo siguiente:
1) La población de interés y el procedimiento científico que se empleo para
obtener la muestra de la población.
2) La muestra y el análisis matemático de su información.
3) Las inferencias estadísticas que resulten del análisis de la muestra.
4) La probabilidad de que esas inferencias sean correctas.
¿POR QUE ESTUDIAR ESTADÍSTICA?
Algunas razones por la que resulta interesante estudiarlo:
Porque sirve como idioma para comunicarse en el mundo universal
de la ciencia y la tecnología. La mayoría de los libros, estudios e
investigaciones especializadas en diversas áreas de las ciencias
sociales, contienen resultados basados en el análisis estadístico.
Ofrece un conjunto de técnicas, métodos, modelos y
procedimientos para el análisis cualitativo y cuantitativo de los
fenómenos y hechos de interés.
Ayuda a efectuar una investigación rigurosa, no es simplemente un
conjunto de formulas, procedimientos y modelos, si no ofrece los
fundamentos lógicos en lo que se sustenta la investigación básica y
aplicada, por lo que constituye la “Tecnología del método
Científico”.
Participa de la solución del problema, puesto que permite revelar
alguna información vital para la solución de un problema práctico.
Ayuda a conocer las características de una población, cuyos
resultados orienta hacia la toma de decisiones.
Permite hacer inferencia acerca de una población a partir de una
muestra.
Universidad Autónoma de Asunción Representaciones Graficas
ESTADÍSTICA E INVESTIGACION
La investigación es un proceso de producción de conocimientos científicos;
proceso sistemático a través del cual se recogen datos e información de la
realidad objetiva para dar respuesta a las interrogantes que se plantean.
Toda investigación requiere de DATOS, sin ellos no hay investigación,
entonces, la estadística como ciencia auxiliar de la investigación, que por
su naturaleza, estructura y método, permite obtener respuesta a los
problemas que se plantean.
Etapas de la Investigación:
1) Planeamiento o Preparación.
2) Recopilación de Datos.
3) Organización y Presentación de Datos.
4) Análisis e interpretación de Datos.
5) Formación de conclusión y preparación de Informe.
Escala: Es la relación que hay entre las unidades y el atributo que se
desea representar.
Niveles de Medición: Para describir un objeto o un individuo hacemos
referencia a las propiedades o atributo que posee. Estos atributos pueden
expresarse en escala de diferentes niveles de medición.
El nivel de medición depende entre otras de uno o más de los siguientes
factores: Naturaleza del atributo, disponibilidad de recursos para efectuar
la medición y precisión requerida en la medición.
Una vez elegido el nivel de medición para el atributo o propiedad, las
unidades de observación pueden ser asignadas a las diferentes categorías
de las escalas correspondientes.
Tipos de Escalas
Escala Nominal: Las diferentes categorías de la escala se distinguen por
el nombre que se le asigna. No existe jerarquía entre las diferentes clases
y su ordenación es arbitraria. Ejemplo: Las causas de la muerte de
pacientes en un hospital, estado civil de las personas, tipo de viviendas,
etc.
Escala Ordinal: Esta escala lleva implícita la idea de cierto orden que
permite indicar la posición de los distintos elementos clasificados y
constituye una etapa de transición hacia la cuantificación de un fenómeno.
Ejemplo: La gravedad de una enfermedad, el nivel socio-económico, el
estado general del paciente, el coeficiente intelectual de las personas. etc.
Universidad Autónoma de Asunción Representaciones Graficas
Escala de Intervalos: Las escalas de intervalos se caracterizan por los
números asignados a las diferentes categorías tienen un significado
cuantitativo claro respecto a la distancia que existe entre dos
observaciones diferentes. Además el cero indica ausencia.
Escala Discontinua o Discreta: Esta escala se refiere a datos que
resultan del recuento de elementos pertenecientes a la unidad de
observación. Ejemplo: Numero de Hijos, Numero de empleados, Numero
de personas que viven en una familia, etc.
Escala Continua: Su característica es la posibilidad de existencia de
infinitos valores intermedios entre una división de la escala y la próxima.
Ejemplo: Peso, longitud, etc.
Escala de Razón: Se caracterizan por los números asignados a las
diferentes categorías tienen un significado cuantitativo claro respecto a la
distancia que existe entre dos observaciones diferentes. Además el cero
no indica ausencia. Ejemplo: Temperatura
Variables: Es una característica que se quiere estudiar de la población o
muestra y que puede asumir diferentes valores. Las variables son
características susceptibles de adoptar distintos valores o referido a la
unidad de análisis y pueden ser medidos o cuantificados. La variable
adquiere un valor determinado en cada unidad de análisis. Si una
característica se encuentra que toma valores diferentes en personas,
lugares o cosas se dice que esta característica es variable, es decir la
característica no es la misma
Las variables pueden ser de dos tipos:
Variables cualitativas o atributos: no se pueden medir
numéricamente, muchas de ellas solo puede catalogarse. Ejemplo:
nacionalidad, color de la piel, sexo, diagnostico de un paciente, el
nivel socio-económico de las personas.
Variables cuantitativas: Es aquélla que puede medirse, tienen
valor numérico. Ejemplo: edad, precio de un producto, ingresos
anuales, Estatura de las personas, Calificaciones de un examen,
etc.).
Las variables también se pueden clasificar en:
Variables unidimensionales: sólo recogen información sobre una
característica (por ejemplo: edad de los alumnos / as de una clase).
Universidad Autónoma de Asunción Representaciones Graficas
Variables bidimensionales: recogen información sobre dos
características de cada elemento de la población simultáneamente
(por ejemplo: edad y altura de los alumnos / as de una clase).
Variables multidimensionales: recogen información sobre tres o
más características de cada elemento (por ejemplo: edad, altura y
peso de los alumnos / as de una clase).
Por su parte, las variables cuantitativas se pueden clasificar atendiendo a
los valores que pueden tomar en discretas y continuas:
Variables Discretas: sólo pueden tomar valores enteros (1, 2, 8, -4,
etc.). Por ejemplo: número de hermanos (puede ser 1, 2, 3...., etc.,
pero, por ejemplo, nunca podrá ser 3,45).
Variables Continuas: pueden tomar cualquier valor real dentro de
un intervalo. Por ejemplo, la velocidad de un vehículo puede ser
80,3 Km. /h, 94,57 Km./h...etc.
Independientemente del tipo de variable con el que se esté trabajando,
cuando se estudia el comportamiento de las mismas hay que distinguir
claramente los siguientes conceptos:
Individuo: cualquier elemento que porte información sobre el fenómeno
que se estudia. Así, si estudiamos la altura de los niños de una clase, cada
alumno o alumna es un individuo; si estudiamos el precio de la vivienda,
cada vivienda es un individuo.
Población: conjunto de todos los individuos (personas, objetos, animales,
etc.) que porten información sobre el fenómeno que se estudia. Por
ejemplo, si estudiamos el precio de la vivienda en una ciudad, la población
será el total de las viviendas de dicha ciudad.
Muestra: subconjunto que seleccionamos de la población. Así, si se
estudia el precio de la vivienda de una ciudad, lo normal será no recoger
información sobre todas las viviendas de la ciudad (sería una labor muy
compleja), sino que se suele seleccionar un subgrupo (muestra) que se
entienda que es suficientemente representativo. Una muestra
representativa será un subconjunto de elementos de una población
obtenidos de forma aleatoria de ella (al azar), es decir habiendo sido
elegidos sin ningún criterio de selección.
Universidad Autónoma de Asunción Representaciones Graficas
Censo: El censo o enumeración completa, es una técnica que permite
averiguar o determinar el valor de los parámetros que ocurren o existen en
el conjunto de elementos o unidades en consideración mediante la revisión
de todos ellos.
Encuesta: Una encuesta se genera o se desarrolla con el fin de cumplir o
satisfacer un objetivo a nivel de muestra, aquel objetivo que norma toda
encuesta. Por ejemplo la encuesta de opinión es la base de muchas de las
noticias que divulgan los diversos medios noticiosos.
Parámetro: Es una característica que se estudiar de la población. Su
resultado contiene una certidumbre total.
Estadístico: Es una característica que se quiere estudiar de la muestra.
Su resultado contiene un grado de incertidumbre.
VENTAJAS DE UNA ENCUESTA Y UN CENSO
ENCUESTA
1) Presupuesto reducido. Economía.
2) Tiempo breve. Rapidez y Oportunidad.
3) Tamaño de la población es pequeña.
4) Calidad y Precisión.
5) Atención a casos individuales.
CENSO
1) Se pueden obtener datos para unidades pequeñas.
2) La aceptación pública es mas fácil de alcanzar para datos
completos.
3) La colaboración y respuesta del público se pueden obtener más
fácilmente.
4) El sesgo de cobertura puede ser más fácil de evaluar y de
reducir.
5) No se requiere de estadístico experto en muestreo.
Universidad Autónoma de Asunción Representaciones Graficas
UNIDAD 2
OBJETIVOS:
1. Utilizar los tres principales tipos de gráficos para representar Datos
Estadísticos. Grafico de Barras, de Líneas y el Circular.
REPRESENTACIONES GRAFICAS
Los cuadros no tienen un poder demostrativo, son más bien ilustrativos, en
cambio los gráficos son demostraciones matemáticas, así como pueden ser
las funciones. Los principales tipos de representaciones gráficas son:
a) Diagramas de barras: Se utilizan para hacer comparaciones con los datos.
Pueden ser simples (una sola serie de datos), compuestos (dos series de
datos), componentes (tres o mas series de datos), bi-direccionales (son los
gráficos de barras en forma horizontal).
Ejemplo 1: En la siguiente tabla se observa la cantidad de alumnos inscriptos
en el turno mañana, primer semestre de la carrera de Administración de
Empresas en el Año 2009. Construya un grafico que nos permita comparar
estos datos.
CUADRO 1 - UNA SERIE
Nº DE
EDADES ALUMNOS
19 A 22 150
23 A 26 450
27 A 30 350
31 A 34 100
Universidad Autónoma de Asunción Representaciones Graficas
GRAFICO DE BARRAS SIMPLES
Nº DE ALUMNOS
500
400
300
ALUMNOS
200
100
0
19 A 22 23 A 26 27 A 30 31 A 34
EDADES
Ejemplo 2: En la siguiente tabla se observa la cantidad de alumnos inscriptos
en el turno mañana, primer semestre de la carrera de Administración de
Empresas, en los Años 2008 y 2009. Construya un grafico que nos permita
comparar estos datos.
CUADRO 2 - DOS SERIES
Año 2008 Año 2009
EDADES Nº DE ALUMNOS
19 A 22 100 150
23 A 26 375 450
27 A 30 265 350
31 A 34 120 100
Universidad Autónoma de Asunción Representaciones Graficas
GRAFICO DE BARRAS COMPUESTAS
Nº DE ALUMNOS
500
450
400
350
300
Año 2008
250
Año 2009
200
150
100
50
0
EDADES 19 A 22 23 A 26 27 A 30 31 A 34
Ejemplo 3: En la siguiente tabla se observa la cantidad de alumnos inscriptos
en el turno mañana, primer semestre de la carrera de Administración de
Empresas, en los Años 2007, 2008 y 2009. Construya un grafico que nos
permita comparar estos datos.
CUADRO 3 - TRES SERIES O MAS
Año Año Año
2007 2008 2009
EDADES N’ DE ALUMNOS TOTAL
19 A 22 85 100 150 335
23 A 26 285 375 450 1110
27 A 30 220 265 350 835
31 A 34 85 120 100 305
Universidad Autónoma de Asunción Representaciones Graficas
GRAFICO DE BARRAS COMPONENTES
Nº DE ALUMNOS
1200
1000
800 Año 2009
600 Año 2008
400 Año 2007
200
0
19 A 22 23 A 26 27 A 30 31 A 34
EDADES
b) Grafico de Líneas: Se utilizan para visualizar tendencias de los datos.
Pueden ser simples (una sola serie de datos), compuestos (dos series de
datos), múltiples (tres o mas series de datos)
Ejemplo 4: En el siguiente cuadro se presenta la evolución histórica del valor
del dólar durante el año 2008. Construya un grafico que nos permita visualizar
tendencia de esta evolución
CUADRO 1 – UNA SERIE
VALOR DEL DÓLAR AÑO 2008
EN GS.
ENERO 4830
FEBRERO 4700
MARZO 4600
ABRIL 4370
MAYO 4100
JUNIO 4150
JULIO 4000
AGOSTO 4000
SETIEMBRE 4000
OCTUBRE 4000
NOVIEMBRE 4625
DICIEMBRE 4840
.
Universidad Autónoma de Asunción Representaciones Graficas
GRAFICO DE LINEAS SIMPLES
EVOLUCION DEL DÓLAR
(EN GUARANIES)
6000
5000
4000
3000 AÑO 2008
2000
1000
0
O
E
AG LIO
E
EM O
E
M L
ZO
CI RE
BR O
M O
O
I
VI BR
BR
NI
O BR
T
FE ER
R
AY
ER
AR
SE OS
DI MB
JU
AB
JU
EM
NO TU
EN
E
C
TI
MESES
Ejemplo 5: En el siguiente cuadro se presenta la evolución histórica del valor
del dólar durante los años 2007 y 2008. Construya un grafico que nos permita
visualizar tendencias de estas evoluciones
CUADRO 2 - DOS SERIES
VALOR DEL
DÓLAR AÑO 2007 AÑO 2008
EN GUARANIES
ENERO 5400 4830
FEBRERO 5200 4700
MARZO 5100 4600
ABRIL 5150 4370
MAYO 5070 4100
JUNIO 5050 4150
JULIO 5150 4000
AGOSTO 5100 4000
SETIEMBRE 5085 4000
OCTUBRE 5030 4000
NOVIEMBRE 4830 4625
DICIEMBRE 4700 4840
Universidad Autónoma de Asunción Representaciones Graficas
GRAFICO DE LINEAS COMPUESTAS
EVOLUCION DEL DÓLAR
(EN GUARANIES)
6000
5000
4000 AÑO 2007
3000
2000 AÑO 2008
1000
0 O
E
AG LIO
EM E
EM O
E
IL
ZO
CI RE
BR O
M O
BR
BR
NI
O BR
T
FE ER
R
AY
ER
AR
SE OS
B
JU
AB
JU
EM
NO TU
EN
VI
TI
DI
MESES
Ejemplo 6: En el siguiente cuadro se presenta la evolución histórica del valor
del dólar durante los años 2006, 2007 y 2008. Construya un grafico que nos
permita visualizar tendencias de estas evoluciones
CUADRO 3 - TRES SERIES O MAS
VALOR DEL
DÓLAR AÑO 2006 AÑO 2007 AÑO 2008
EN GUARANIES
ENERO 6100 5400 4830
FEBRERO 6130 5200 4700
MARZO 6100 5100 4600
ABRIL 5900 5150 4370
MAYO 5850 5070 4100
JUNIO 5800 5050 4150
JULIO 5700 5150 4000
AGOSTO 5600 5100 4000
SETIEMBRE 5600 5085 4000
OCTUBRE 5500 5030 4000
NOVIEMBRE 5500 4830 4625
DICIEMBRE 5400 4700 4840
Universidad Autónoma de Asunción Representaciones Graficas
GRAFICO DE LINEAS MULTIPLES
EVOLUCION DEL DÓLAR
(EN GUARANIES)
7000
6000
5000 AÑO 2006
4000 AÑO 2007
3000
2000 AÑO 2008
1000
0
O
E
AG IO
EM E
TO
E
IL
ZO
CI RE
FE RO
BR
NI
BR
R
AY
ER
NO U B
AR
SE OS
B
JU
AB
E
JU
EM
EM
EN
M
BR
T
M
VI
TI
DI
MESES
c) Diagramas de sectores o Grafico Circular o Torta: Son círculos o elipses
en donde los sectores angulares representan proporcionalmente los
porcentajes correspondientes a cada variable.
Se obtienen dividiendo la circunferencia en tantas partes como valores tenga la
variable de manera que el área de cada sector obtenido sea proporcional a la
respectiva frecuencia.
Ejemplo 7: En la siguiente tabla se observa la cantidad de alumnos inscriptos
en el turno mañana, primer semestre de la carrera de Administración de
Empresas en el Año 2009. Construya un grafico que nos permita observar los
porcentajes correspondientes a estos datos.
TABLA ORIGINAL
Nº DE
EDADES ALUMNOS
19 A 22 150
23 A 26 450
27 A 30 350
30 A 34 100
Universidad Autónoma de Asunción Representaciones Graficas
TABLA A CONSTRUIR
Nº DE
EDADES ALUMNOS % GRADOS
19 A 22 150 14 51
23 A 26 450 43 154
27 A 30 350 33 120
30 A 34 100 10 34
1050 100 360
INSTRUCCIONES A SEGUIR
Primer paso: Sumar la columna de Número de alumnos para saber el total de
alumnos inscriptos.
Segundo Paso: Determinar los porcentajes que corresponden a cada intervalo
de edades, dividiendo el numero de alumnos de cada intervalo con el total de
alumnos, multiplicado por 100, redondear sin decimales. La suma de esta
columna debe ser el 100%.
Tercer Paso: Determinar los grados que corresponden a cada intervalo de
edades, multiplicando el porcentaje de alumnos de cada intervalo por 360,
dividido por 100, redondear sin decimales. La suma de esta columna debe ser
de 360 grados.
Cuarto Paso: Con la ayuda de un transportador de grados ir ubicando en el
círculo los grados que corresponden a cada intervalo. No olvidar de colocar
los porcentajes en cada sector, así como también las referencias que
corresponden a cada ítem, además del titulo de nuestro grafico.
Universidad Autónoma de Asunción Representaciones Graficas
GRAFICO DE SECTORES O CIRCULAR O TORTA
ALUMNOS INSCRIPTOS POR EDADES
AÑO 2009
10% 14%
19 A 22
23 A 26
27 A 30
33%
30 A 34
43%
d) Otros Gráficos: Son aquellos que utilizan paquetes estadísticos. Los más
conocidos son los Histogramas de frecuencias, los polígonos de frecuencias y
las Ojivas.
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
DESARROLLO CLASE 2
UNIDAD 2
OBJETIVO:
1. Construir tablas de distribuciones de frecuencia que permita una mejor visión
de lo que acontece con los datos manejados. Representarlos mediante los
Histogramas de Frecuencias, los Polígonos de Frecuencias y Las Ojivas.
En este capítulo, podrás conocer las diferentes formas de presentación de
datos, para el efecto te sugerimos leer el Capítulo correspondiente de tu texto
básico, donde encontrarás todo lo relacionado a los mismos. Procura fijar con
claridad los conceptos de Tabla de distribución de frecuencias y sus elementos,
tales como frecuencia, limites o Intervalos de clase, limites reales de clase,
Tamaño de clases, Punto medio o marca de clase, frecuencias simples,
acumuladas, desacumuladas y relativas simples, acumuladas y
desacumuladas, así como los diversos tipos de representaciones gráficas,
histograma, polígono de frecuencias, y las ojivas Menor que y Mayor que..
TABLAS DE DISTRIBUCIÓN DE FRECUENCIAS
Es la parte elemental de la estadística y su propósito es describir las
características de los datos reunidos que pueden corresponder a una población
generalmente pequeña y /o a los datos todas en poblaciones grandes.
Para elaborar una tabla y realizar su graficación se precisan datos
estadísticos, entendiéndose por dato estadístico el valor numérico de una
variable; así por ejemplo, la talla, el peso, el ingreso mensual, etc. de una
persona, constituyen datos estadísticos. Las variables son símbolos, tal como
X, Y, Z, P, Q que puede tomar un conjunto de valores, llamado dominio de
variable. Se clasifican en continuas y discretas; es continua cuando puede
tomar cualquier valor entre dos valores continuos, por ejemplo entre 1 y 2
existen infinitos valores, así 1.256; 1.428; 1.088; etc.; es discreta cuado toma
un solo valor entero, ejemplo, 0; 1, 10, 100, etc. Si la variable puede tomar un
solo valor se llama constante.
Como vamos a trabajar con datos es necesario conocer que esos
pueden ser cuantitativos o cualitativos, los datos cuantitativos representan la
cantidad de algo, la producción mensual de banano, la producción diaria de
petróleo, tiempo requerido para reparar cierta máquina, son ejemplos de datos
cuantitativos. Los datos que solamente se pueden catalogar o describir se
llaman cualitativos, por ejemplo, la profesión de cierto grupo de personas.
1
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
En una tabla los datos se representan ordenados según su magnitud y
frecuencia, que puede ser absoluta o relativa; la absoluta equivale al número
de veces que se repite un dato y las relativas que corresponden a una fracción
entre una absoluta particular y la frecuencia acumulada o número total de
observaciones. Una observación solo puede ser ubicada en uno y solo uno de
los Intervalos de Clase.
Para construir una tabla de distribución de frecuencias hay que
tener en cuenta los siguientes principios:
1. Determinar el número de clases con las cuales deseamos trabajar.
Generalmente es mejor utilizar como mínimo 5 y como máximo 20 intervalos
de clase. Hay que utilizar más clases cuando se dispone de muchos datos.
Cuando el número de clases es demasiado pequeño, se quedan ocultas
características importantes de los datos al agruparlos, y por el contrario si el
número de clases es muy grande, es posible tener muchas clases vacías, y la
distribución dará una deficiente descripción de los datos.
2. Determinar el rango o amplitud y el tamaño de clase del intervalo. Para
encontrar el tamaño de clase, se divide la diferencia entre el mayor valor y el
menor valor (Rango), con el número deseado de clases a utilizar en la tabla.
Los intervalos de clases a utilizar deben tener el mismo tamaño de clase, para
poder hacer comparaciones uniformes de las frecuencias de clase. Además
tratar en la práctica que la cantidad de intervalos no sea menos de 5 o máximo
de 9, por la cantidad de cálculos que se debe realizar. Es recomendable que el
tamaño de clase de los intervalos (de cuanto en cuanto crecen los intervalos)
sean múltiplos de 5 o de 10, así como también el límite inferior nominal de la
primera clase.
3. Obtener los límites de clase. Se empieza con la menor clase para poder
incluir la medición más pequeña. Se tendría que escoger los límites de manera
que sería imposible para una medición el caer en un límite.
Ejemplo 1: Consideramos el siguiente conjunto de datos que corresponden a
las edades de 50 socios de una cooperativa.
Construya una tabla de distribución de frecuencias que contenga 9 intervalos y
complete la misma con las frecuencias relativas, frecuencias acumuladas,
relativas acumuladas, frecuencias desacumuladas, relativas desacumuladas,
marcas de clase. Grafica un histograma y un polígono de frecuencias, además
de las ojivas menor que y mayor que.
2
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
56 43 36 32 51 38 27 29 45 31
49 57 61 36 18 60 40 21 34 49
42 37 47 51 56 33 44 30 17 37
36 41 37 41 21 22 48 51 31 40
23 39 42 17 29 27 25 49 50 37
Si observamos los datos nos damos cuenta de que el mayor valor es 61 y el
menor valor es 17 lo que quiere decir que las 48 observaciones restantes se
encuentran comprendidas entre 17 y 61. Si dividimos el rango (Mayor valor –
Mínimo valor) por la cantidad de intervalos que quiero utilizar, su resultado me
dará el tamaño de clase deseado para mi tabla de frecuencia. Si el ancho de
clase es de 5 tendríamos 61–-17 = 44 este valor es la distancia que existe
entre la mayor y la menor edad de los socios de la cooperativa. Este valor
obtenido se divide por la cantidad de intervalos que me pide el ejercicio, es
44
decir 9, entonces = 4,89 = 5, conviene siempre redondear el tamaño de
9
clases a utilizar en un número múltiplo de 5 o de 10.
Para poder empezar la tabla de distribución de frecuencia, nos fijamos en el
menor valor del conjunto de datos, es 17, también es recomendable empezar la
tabla de frecuencias con un número múltiplo de 5 o de 10, como 17 no lo es
podríamos empezar con 15, con un tamaño de clase de 5 es decir, la tabla de
frecuencia crece de 5 en 5 en forma vertical, primero calculamos los limites
inferiores de clases. Para empezar el limite superior de la primera clases se le
resta 1 al limite inferior de la segunda clase, es decir que los LIC serían 15, 20,
25, 30,…..y los limites superiores de clases empezaríamos con 20-1=19, y se
le suma el mismo tamaño de clases o sea 5, entonces los LSC serán 19, 24,
29, 34… y así sucesivamente, el primer intervalo 15 a 19, 20 a 24 y así
sucesivamente, determinando luego la frecuencia simple, que es el número de
observaciones o valores que caen dentro de cada intervalo. Estos son los
limites nominales de clase, es decir Limite Inferior y superior de clase (LIC-
LSC). Luego hallamos los límites reales de clase (LRI-LRS), para ello sumamos
el límite superior de la primera clase, con el límite inferior de la segunda clase,
dividido 2. Ejemplo: (20+19)/2 = 19,5 siendo este valor el primer limite real
superior de la primera clase y limite real inferior de la segunda clase, a partir
del mismo se le suma el tamaño de clase (5) a este valor para obtener los
demás limites reales,
3
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
TABLA DE DISTRIBUCION FRECUENCIA Y REFERENCIA RELATIVA DE
LOS DATOS DEL EJEMPLO.
EDADES EDADES Nº DE SOCIOS
Limite Conteo Limite Real Frecuencia Frecuencia Marca de Clase
Nominal de Clase Simple relativa simple o Punto medio
de clase
LIC – LSC Tarjas LRI – LRS f fr% X= (LRI+LRS) /2
15 - 19 III 14.5 – 19.5 3 3/ 50*100 = 6 17
20 - 24 IIII 19.5 – 24.5 4 4/ 50*100 = 8 22
25 - 29 IIIII 24.5 – 29.5 5 5/ 50*100 = 10 27
30 - 34 IIIIII 29.5 – 34.5 6 6/ 50*100 = 12 32
35 - 39 IIIIIIIII 34.5 – 39.5 9 9/ 50*100 = 18 37
40 - 44 IIIIIIII 39.5 – 44.5 8 8/ 50*100 = 16 42
45 - 49 IIIIII 44.5 – 49.5 6 6/ 50*100 = 12 47
50 - 54 IIII 49.5 – 54.5 4 4/ 50*100 = 8 52
55 - 59 III 54.5 – 59.5 3 3/ 50*100 = 6 57
60 - 64 II 59.5 – 64.5 2 2/ 50*100 = 4 62
∑f = 50 ∑fr % = 100
La tabulación resultante puede presentarse gráficamente en un histograma de
frecuencia que puede ser de frecuencias simples o relativas. Un histograma,
consiste en un conjunto de rectángulos con base en el eje X con centros en las
marcas de clase o punto de intervalos de clase y longitudes iguales a los
tamaños de los intervalos de clase; las áreas son proporcionales a las
frecuencias simples de clase. Si los intervalos de clase tienen todos los mismos
tamaños, las alturas de los rectángulos son proporcionales a las frecuencias de
la clase y es por eso que se acostumbra a tomar las alturas iguales a las
frecuencias de clase.
4
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
HISTOGRAMA DE FRECUENCIAS
Nº DE SOCIOS
10 EDADES
19.5 - 24.5
8 24.5 - 29.5
6 29.5 - 34.5
f
34.5 - 39.5
4 39.5 - 44.5
2 44.5 - 49.5
49.5 - 54.5
0 54.5 - 59.5
LRI - LRS 59.5 - 64.5
Un polígono de frecuencias, consiste en un conjunto de líneas con base en el
eje X con centros en las marcas de clase o puntos medios de clase y
longitudes iguales a los tamaños de los intervalos de clase; se ubican los
puntos a la altura de las frecuencias simples para posteriormente unirlos entre
sí por medio de líneas. Para empezar y cerrar el gráfico del polígono
necesitamos comenzar con una marca de clase inferior al primero y un superior
al último que figura en la Tabla de Frecuencias.
5
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
POLIGONO DE FRECUENCIAS
N' DE SOCIOS
10
9
8 8
6 6 6
5 SOCIOS
f
4 4 4
3 3
2 2
0 0 0
X
Frecuencias acumuladas, desacumuladas, relativas acumuladas y
desacumuladas
Limites Reales
de Clase
LRI - LRS f fr% fa Fr a% fd f rd% X
14.5 - 19.5 3 6 3 6 50 100 17
19.5 - 24.5 4 8 7 14 47 94 22
24.5 - 29.5 5 10 12 24 43 86 27
29.5 - 34.5 6 12 18 36 38 76 32
34.5 - 39.5 9 18 27 54 32 64 37
39.5 - 44.5 8 16 35 70 23 46 42
44.5 - 49.5 6 12 41 82 15 30 47
49.5 - 54.5 4 8 45 90 9 18 52
54.5 - 59.5 3 6 48 96 5 10 57
59.5 - 64.5 2 4 50 100 2 4 62
50 100%
En esta tabla se tienen registrados las columnas de las frecuencias simples (f),
frecuencias relativas simples en porcentaje (fr%), frecuencias acumuladas (fa),
frecuencias relativas acumuladas en porcentaje (fra%), frecuencias
desacumuladas (fd), frecuencias relativas desacumuladas en porcentajes
(frd%) y las marcas de Clase(X).
6
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
La columna de frecuencia relativa simple se obtiene dividiendo cada una de las
frecuencias simples por el total, multiplicando este resultado por 100.
Para la columna de frecuencias acumuladas se empieza por la primera
frecuencia simple, para la segunda fa a la primera fa se le suma la segunda
frecuencia simple (f), para la tercera fa se le suma a la segunda fa, la tercera
frecuencia simple, y así sucesivamente hasta la ultima fa que es igual al total
del conjunto de Datos.
La columna de frecuencias relativas acumuladas se obtiene dividiendo cada
una de las frecuencias acumuladas por el total, multiplicando este resultado por
100.
La Ojiva menor que, es el gráfico que le corresponde a la frecuencia
acumulada.
OJIVA MENOR QUE
Nº DE SOCIOS
fa
60
50
40
30 Nº DE SOCIOS
20
10
0
LRS
Para la columna de frecuencias desacumuladas se empieza por el total de
datos, la segunda frecuencia desacumulada se obtiene restando la primera fd,
que es el total a primera frecuencia simple, para la tercera fd se resta la
segunda fd con la segunda f simple y así sucesivamente hasta la última fd que
es igual a la última f simple. La columna de frecuencia relativa desacumulada
se obtiene dividiendo cada una de las frecuencias desacumuladas por el total,
multiplicando este resultado por 100.
La Ojiva mayor que, es el gráfico que le corresponde a la frecuencia
desacumulada.
7
Universidad Autónoma de Asunción Tablas de Distribución de Frecuencias
OJIVA MAYOR QUE
Nº DE SOCIOS
fd
60
50
40
30 Nº DE SOCIOS
20
10
0
LRI
8
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
CLASE 3
MEDIDAS DE TENDENCIA CENTRAL
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
¿Qué son las medidas de tendencia central?
Las medidas de tendencia central corresponden a valores que
generalmente se ubican en la parte central de un conjunto de
datos, que nos ayudan a resumir la información en un sólo
número.
Recordemos que los datos pueden ser simples o agrupados.
Los datos simples son aquellos que se presentan de manera
individual y dispersa. Por ejemplo, las estaturas de un grupo
de personas: 154 cm, 186cm, 167cm, 159cm, 183 cm…
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
Los datos agrupados son aquellos que se presentan en tablas
de frecuencias. Por ejemplo, el peso de un conjunto de
individuos:
Peso (kg) Nº individuos
60 – 64 8
65 – 69 15
70 – 74 26
75 – 79 30
80 – 84 11
85 – 89 7
En esta clase estudiaremos el cálculo de las medidas
de tendencia central para datos simples.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
¿Cuáles son las medidas de tendencia central?
Básicamente son 3:
La media aritmética, que es el valor promedio de un conjunto
̅.
de datos. Se representa con el símbolo 𝒙
La mediana, que es el valor central de un conjunto de datos.
Se representa como Me.
La moda, que es el valor más frecuente de un conjunto de
datos. Se representa como Mo.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
¿Cómo se encuentran las medidas de tendencia central en
un conjunto de datos no agrupados?
Ejemplo 1. El número de pacientes ingresados a un hospital
durante los últimos 5 días es: 52, 90, 133, 75, 150. La media
aritmética se calcula sumando el número de pacientes
ingresados, y dividiendo este resultado entre la cantidad de
días. Es decir:
52 + 90 + 133 + 75 + 150 500
𝑥̅ = = = 100
5 5
Esto quiere decir que el promedio de pacientes ingresados
durante los últimos 5 días es de 100 pacientes por día.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
Ejemplo 2. Las calificaciones obtenidas por dos grupos de
alumnos en un examen de Estadística se detalla de la siguiente
manera: Grupo A: 65, 74, 48, 90, 88. Grupo B: 83, 95, 44, 64,
70, 32.
Vemos que en el grupo A tenemos 5 datos, es decir, una
cantidad impar, por lo tanto, la mediana será el valor central
del conjunto, una vez que lo ordenemos de menor a mayor, es
decir: 48, 65, 74, 88, 90. Por lo tanto, para el grupo A, Me = 74.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
En el grupo B tenemos 6 datos, una cifra par. Ordenamos los
datos de menor a mayor: 32, 44, 64, 70, 83, 95. Por lo tanto, la
64+70 134
mediana será: 𝑀𝑒 = = = 67.
2 2
Esto quiere decir que, en el grupo A la mitad de las
calificaciones obtenidas son inferiores a 74, y la mitad restante
de las calificaciones son superiores a 74.
De la misma manera, en el grupo B la mitad de las
calificaciones obtenidas son inferiores a 67, y la mitad restante
de las calificaciones son superiores a 67.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
Ejemplo 3. Durante las últimas 4 semanas, las temperaturas
máximas registradas en la ciudad de Asunción fueron las
siguientes:
Semana 1: 33, 36, 38, 35, 32, 36, 37
Semana 2: 34, 37, 36, 34, 36, 30, 31
Semana 3: 32, 31, 30, 33, 32, 30, 31
Semana 4: 37, 31, 33, 32, 35, 28, 26
Si queremos hallar la moda de estos conjuntos de datos,
simplemente buscamos el valor (o los valores) que se repite
más veces que los demás.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos no agrupados
Entonces, para este ejemplo, tenemos lo siguiente:
Semana Moda
1 Mo = 36
2 Mo = 34; 36
3 Mo = 30, 31, 32
4 Mo: no existe
Cuando el conjunto de datos tiene una sola moda, el conjunto
es unimodal (semana 1). Cuando tiene dos modas, es
bimodal (semana 2). Si tiene más de dos modas, es
multimodal (semana 3). Si no tiene moda, el conjunto es
amodal (semana 4).
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
CLASE 4
MEDIDAS DE TENDENCIA CENTRAL
(Datos agrupados)
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
En la clase anterior vimos que: Las medidas de tendencia central
corresponden a valores que generalmente se ubican en la parte
central de un conjunto de datos, que nos ayudan a resumir la
información en un sólo número.
Además, aprendimos cómo calcular las medidas de tendencia central en
un conjunto de datos simples, también conocidos como datos no
agrupados.
En esta clase, veremos cómo calcular las medidas de tendencia
central en un conjunto de datos agrupados.
Los datos agrupados son aquellos que se presentan en tablas de
frecuencias. Por ejemplo, el peso de un conjunto de individuos:
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
Peso (kg) Nº individuos En esta tabla:
70 – 74 8 el número de clases es 6.
el tamaño de clases es 5, puesto que
75 – 79 12
la diferencia entre el límite inferior (o
80 – 84 18 superior) de una clase y la siguiente
85 – 89 6 clase es 5.
90 – 94 4 las frecuencias corresponden al
número de individuos de cada clase.
95 – 99 2
Empezaremos calculando la media aritmética. Para datos agrupados,
la fórmula es la siguiente:
x : mediaaritmética
x f x x : marcadeclase
f
f : frecuencia
El símbolo ∑ indica sumatoria.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
Para esta fórmula necesitaremos calcular para cada clase: la marca de
clase (x) y también el producto de cada frecuencia por su marca de clase
(f.x). Recordemos que la marca de clase es el punto medio entre los límites
de cada clase. Nos queda:
LI LS f x f.x
70 74 8 (70 + 74) / 2 = 72 8 x 72 = 576
75 79 12 (75 + 79) / 2 = 77 12 x 77 = 924
80 84 18 (80 + 84) / 2 = 82 18 x 82 = 1476
85 89 6 (85 + 89) / 2 = 87 6 x 87 = 522
90 94 4 (90 + 94) / 2 = 92 4 x 92 = 368
95 99 2 (95 + 99) / 2 = 97 2 x 97 = 194
50 4060
4060
Entonces la media aritmética será: 𝑥̅ = = 81,2
50
El peso promedio de este grupo de individuos será 81,2 kg
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
Ahora vamos a calcular la mediana. Para datos agrupados, la fórmula
es la siguiente:
f faa
2
Me LRI c
f
En esta fórmula:
LRI es el límite real inferior de la clase mediana.
faa es la frecuencia acumulada anterior a la de la clase mediana.
c es el tamaño de clases.
f es la frecuencia de la clase mediana.
La clase mediana es la clase en la que se encuentra la primera frecuencia
∑𝑓 ∑𝑓
acumulada mayor o igual a ( = la mitad del total de frecuencias).
2 2
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
LI LS f fa
70 74 8 8
75 79 12 8 + 12 = 20
80 84 18 20 + 18 = 38
85 89 6 38 + 6 = 44
90 94 4 44 + 4 = 48
95 99 2 48 + 2 = 50
50
¿Cómo sabemos cuál será la clase mediana? Buscamos la clase en la
∑𝑓
que esté la primera frecuencia acumulada mayor o igual a , es decir,
2
mayor o igual a 50 / 2 = 25. Entonces:
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
LRI LI LS f fa
70 74 8 8
75 79 12 20
Clase mediana (porque 38 es la primera
79,5 80 84 18 38 frecuencia acumulada mayor o igual a 25)
85 89 6 44
90 94 4 48
95 99 2 50
50
50
−20
2
Entonces, reemplazando todo tendremos: 𝑀𝑒 = 79,5 + [ ] × 5 = 80,9
18
La mitad de las personas de este grupo pesan menos que 80,9 kg
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
Finalmente calcularemos la moda. Para datos agrupados, la fórmula es
la siguiente:
MoLRI 1 c
12
En esta fórmula:
LRI es el límite real inferior de la clase modal.
Δ1 = f – f anterior
Δ2 = f – f posterior
f es la mayor frecuencia
f anterior es la frecuencia anterior a la mayor.
f posterior es la frecuencia posterior a la mayor.
c es el tamaño de clases.
La clase modal es la clase que tiene la mayor frecuencia.
Universidad Autónoma de Asunción Medidas de tendencia central – Datos agrupados
En esta tabla tendremos:
LRI LI LS f
70 74 8
75 79 12
79,5 80 84 18 Clase modal Δ1 = 18 – 12 = 6
85 89 6 Δ2 = 18 – 6 = 12
90 94 4
95 99 2
Reemplazando nos queda:
6
𝑀𝑜 = 79,5 + [ ] × 5 = 81,2
6 + 12
El valor más frecuente entre estos individuos es 81,2 kg
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
CLASE 5
MEDIDAS DE DISPERSION
(Datos no agrupados)
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Ya estudiamos anteriormente las medidas de tendencia central, que nos
indican hacia qué valores se centraliza un conjunto de datos. Ahora,
observemos la siguiente situación:
Dos grupos de alumnos rindieron el mismo examen, obteniendo las
siguientes calificaciones:
Grupo A: 62, 63, 64, 65, 66 Grupo B: 28, 31, 74, 92, 95
Trataremos de buscar un valor representativo para ambos conjuntos,
utilizando la media aritmética para compararlos:
Grupo A Grupo B
̅ ̅
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Observamos que la calificación promedio en ambos grupos fue de 64
puntos. Sin embargo, aunque ambos grupos tengan el mismo promedio
de calificaciones, este dato no refleja la siguiente situación:
Las calificaciones del grupo A están más concentradas alrededor del
promedio.
La mayoría de las calificaciones del grupo B están alejadas del
promedio.
Esto quiere decir que, en el grupo A se observa menor dispersión en
cuanto a las calificaciones obtenidas, mientras que en el grupo B la
dispersión es mayor.
Para calcular la dispersión de un conjunto de datos, podemos utilizar
diferentes medidas, que veremos a continuación.
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Las medidas de dispersión reflejan la mayor o menor
concentración con que se encuentran distribuidos los valores de
la serie alrededor de un valor central.
Las medidas que estudiaremos son las siguientes:
Rango o recorrido (R): Es la medida de dispersión más sencilla. Es la
distancia entre el valor máximo y el valor mínimo en una serie de datos.
Su uso no es muy aconsejado ya que no refleja la dispersión que existe
dentro de todo el conjunto de datos.
Fórmula:
Ejemplo. Las temperaturas máximas registradas durante la última
semana en Asunción fueron las siguientes: 22, 26, 28, 25, 29, 30, 28. El
rango del conjunto de datos será: grados.
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Desviación media (DM): Es la media aritmética de los valores absolutos
de las desviaciones respecto al promedio.
| ̅|
Fórmula:
En esta fórmula: es cada valor del conjunto de datos, ̅ es el
promedio del conjunto de datos, es la cantidad de datos. La expresión
| ̅ | es la desviación de cada valor respecto al promedio. Las barras
que rodean a la resta indican valor absoluto, es decir, el resultado de la
resta, ya sea positivo o negativo, se escribe como un número positivo.
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Ejemplo. Dos grupos de alumnos rindieron el mismo examen,
obteniendo las siguientes calificaciones:
Grupo A: 62, 63, 64, 65, 66 Grupo B: 28, 31, 74, 92, 95
Primeramente, para hallar la desviación media de ambos conjuntos,
debemos calcular el promedio:
Grupo A Grupo B
̅ ̅
Luego, calculamos la desviación para cada valor de ambos conjuntos, de
la siguiente manera:
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Grupo A Grupo B
| ̅| | ̅|
62 |62 – 64| = 2 28 |28 – 64| = 36
63 |63 – 64| = 1 31 |31 – 64| = 33
64 |64 – 64| = 0 74 |74 – 64| = 10
65 |65 – 64| = 1 92 |92 – 64| = 28
66 |66 – 64| = 2 95 |95 – 64| = 31
| ̅| = 6 | ̅ | = 138
Por lo tanto, para cada grupo, la desviación media será:
Grupo A Grupo B
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Como podemos observar, las calificaciones del grupo B están más
dispersas con relación a las calificaciones del grupo A.
Desviación típica o estándar (S): Es una medida que se usa para
cuantificar la variación o dispersión de un conjunto de datos numéricos.
Una desviación típica baja indica que la mayor parte de los datos de una
muestra tienden a estar agrupados cerca de su media, mientras que una
desviación típica alta indica que los datos se extienden sobre un rango
de valores más amplio.
̅
Fórmula: √
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
En esta fórmula: es cada valor del conjunto de datos, ̅ es el
promedio del conjunto de datos, es la cantidad de datos. La expresión
̅ es el cuadrado de la desviación de cada valor respecto al
promedio.
Ejemplo. Las estaturas, en centímetros, de los integrantes de dos
equipos de atletismo son las siguientes:
Equipo A: 188, 188, 187, 185, 184, 193
Equipo B: 187, 177, 188, 180, 176, 181
Primeramente, para hallar la desviación típica de ambos conjuntos,
debemos calcular el promedio:
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Equipo A: ̅ cm.
Equipo B: ̅ cm.
Luego, calculamos el cuadrado de la desviación de cada valor de ambos
conjuntos, de la siguiente manera:
Equipo A Equipo B
̅ ̅
188 (188 – 187,5)2 = 0,25 187 (187 – 181,5)2 = 30,25
188 (188 – 187,5)2 = 0,25 177 (177 – 181,5)2 = 20,25
187 (187 – 187,5)2 = 0,25 188 (188 – 181,5)2 = 42,25
185 (185 – 187,5)2 = 6,25 180 (180 – 181,5)2 = 2,25
184 (184 – 187,5)2 = 12,25 176 (176 – 181,5)2 = 30,25
193 (193 – 187,5)2 = 30,25 181 (181 – 181,5)2 = 0,25
̅ = 49,5 ̅ = 125,5
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Por lo tanto, para cada equipo, la desviación típica será:
Equipo A Equipo B
√ cm. √ cm.
Como podemos observar, en el equipo B las estaturas se encuentran
más dispersas respecto al promedio, en comparación con el equipo A.
Varianza (V): Es el promedio del cuadrado de cada desviación respecto
a la media aritmética, o bien, es el cuadrado de la desviación típica de un
conjunto de datos.
Fórmula: . En esta fórmula, S representa la desviación típica.
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Ejemplo. Tomando los datos del ejemplo anterior, vemos que para cada
equipo, la desviación típica es:
Equipo A: S = 2,87 cm. Equipo B: S = 4,57 cm.
Calculamos la varianza para ambos equipos de la siguiente manera:
Equipo A: V = 2,872 = 8,24
Equipo B: V = 4,572 = 20,88
Al igual que cuando calculamos la desviación típica de ambos equipos, la
interpretación será la misma. Es decir, en el equipo B las estaturas se
encuentran más dispersas respecto al promedio, en comparación con el
equipo A.
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Coeficiente de variación (CV): Es una magnitud relativa de la
desviación típica con respecto al promedio. Nos da el porcentaje de
variación de los datos con respecto al promedio.
Fórmula:
̅
En esta fórmula: es la desviación típica del conjunto, ̅ es el promedio
del conjunto de datos. El resultado es expresado como porcentaje.
El resultado del coeficiente de variación indica si existe una baja o alta
dispersión de los datos, siendo la media aritmética o promedio de este
conjunto representativo o no del mismo.
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Interpretación del coeficiente de variación
Valores del CV Dispersión Representatividad de la media
0% ≤ CV < 20% Pequeña Muy representativa
20% ≤ CV < 50% Regular Representativa
50% ≤ CV < 70% Alta Poco representativa
70% ≤ CV ≤ 100% Muy alta No representativa
Ejemplo. En un grupo de estudiantes, se obtuvieron los siguientes datos
respecto a las edades de los mismos:
Hombres: ̅
Mujeres: ̅
Calculamos el coeficiente de variación para ambos grupos:
Hombres:
Mujeres:
Universidad Autónoma de Asunción Medidas de dispersión – Datos no agrupados
Observamos que el coeficiente de variación nos indica que:
En el grupo de los hombres, la dispersión es pequeña y la media es
muy representativa.
En el grupo de las mujeres, la dispersión es muy alta y la media no
es representativa.
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
CLASE 6
MEDIDAS DE DISPERSION
(Datos agrupados)
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
En la clase anterior, estudiamos las medidas de dispersión, y el cálculo
de las mismas para conjuntos de datos no agrupados. Ahora,
estudiaremos cómo calcular estas medidas en conjuntos de datos
agrupados.
Conviene aclarar que las medidas son las mismas:
Desviación media
Desviación típica
Varianza
Coeficiente de variación
Rango o recorrido
También la interpretación de estas medidas es igual en el caso de los
datos agrupados.
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
Desviación media (DM): Es la media aritmética de los valores absolutos
de las desviaciones respecto al promedio.
( | ̅ |)
Fórmula para datos agrupados:
En esta fórmula: es cada marca de clase, ̅ es el promedio del
conjunto de datos, es la sumatoria de las frecuencias de todas las
clases. La expresión | ̅ | es la desviación de cada valor respecto al
promedio. Las barras que rodean a la resta indican valor absoluto, es
decir, el resultado de la resta, ya sea positivo o negativo, se escribe
como un número positivo.
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
Ejemplo. En la siguiente tabla se detalla la cantidad de horas extras
trabajadas por un grupo de empleados de una empresa durante el mes
de febrero:
Hs extra 20 – 22 23 – 25 26 – 28 29 – 31 32 – 34
Nº empleados 9 12 18 7 4
Primeramente, para hallar la desviación media de la distribución de
frecuencias, debemos calcular el promedio. Recordemos que, para un
conjunto de datos agrupados, el promedio se calcula mediante la
( )
siguiente fórmula: ̅
Con esto, nuestra tabla de frecuencias quedará de la siguiente manera:
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
LI LS f x f·x | ̅|
20 22 9 21 189 9 | 21 – 26,1 | = 45,9
23 25 12 24 288 12 | 24 – 26,1 | = 25,2
26 28 18 27 486 18 | 27 – 26,1 | = 16,2
29 31 7 30 210 7 | 30 – 26,1 | = 27,3
32 34 4 33 132 4 | 33 – 26,1 | = 27,6
50 1305 142,2
Primeramente se calculó la media aritmética: ̅
Con este resultado, se agregó la última columna de la tabla, que es la
que nos sirve para obtener la desviación media:
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
Desviación típica o estándar (S): Es una medida que se usa para
cuantificar la variación o dispersión de un conjunto de datos numéricos.
Una desviación típica baja indica que la mayor parte de los datos de una
muestra tienden a estar agrupados cerca de su media, mientras que una
desviación típica alta indica que los datos se extienden sobre un rango
de valores más amplio.
[ ( ̅) ]
Fórmula para datos agrupados: √
En esta fórmula: es cada marca de clase, ̅ es el promedio del
conjunto de datos, es la sumatoria de las frecuencias de todas las
clases. La expresión ( ̅ ) es el cuadrado de la desviación de cada
valor respecto al promedio.
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
Ejemplo. En la siguiente tabla se registran los kilómetros recorridos por
una muestra de atletas, como preparación durante la semana previa a
una maratón:
Kilómetros 10 – 16 17 – 23 24 – 30 31 – 37 38 – 44
Nº atletas 5 10 13 8 4
Primeramente, para hallar la desviación típica de la distribución de
frecuencias, debemos calcular el promedio. Recordemos que, para un
conjunto de datos agrupados, el promedio se calcula mediante la
( )
siguiente fórmula: ̅
Con esto, nuestra tabla de frecuencias quedará de la siguiente manera:
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
LI LS f x f·x ( ̅)
10 16 5 13 65 5 (13 – 26,3)2 = 884,45
17 23 10 20 200 10 (20 – 26,3) 2 = 396,9
24 30 13 27 351 13 (27 – 26,3) 2 = 6,37
31 37 8 34 272 8 (34 – 26,3) 2 = 474,32
38 44 4 41 164 4 (41 – 26,3) 2 = 864,36
40 1052 2626,4
Primeramente se calculó la media aritmética: ̅
Con este resultado, se agregó la última columna de la tabla, que es la
que nos sirve para obtener la desviación típica:
√
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
Varianza (V): Es el promedio del cuadrado de cada desviación respecto
a la media aritmética, o bien, es el cuadrado de la desviación típica de un
conjunto de datos.
Fórmula: . En esta fórmula, S representa la desviación típica.
Ejemplo. Tomando los datos del ejemplo anterior, vemos que la
desviación típica resultó igual a 8,1. Por tanto, la varianza será:
Coeficiente de variación (CV): Es una magnitud relativa de la
desviación típica con respecto al promedio. Nos da el porcentaje de
variación de los datos con respecto al promedio.
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
Fórmula:
̅
En esta fórmula: es la desviación típica del conjunto, ̅ es el promedio
del conjunto de datos. El resultado es expresado como porcentaje.
El resultado del coeficiente de variación indica si existe una baja o alta
dispersión de los datos, siendo la media aritmética o promedio de este
conjunto representativo o no del mismo.
Interpretación del coeficiente de variación
Valores del CV Dispersión Representatividad de la media
0% ≤ CV < 20% Pequeña Muy representativa
20% ≤ CV < 50% Regular Representativa
50% ≤ CV < 70% Alta Poco representativa
70% ≤ CV ≤ 100% Muy alta No representativa
Universidad Autónoma de Asunción Medidas de dispersión – Datos agrupados
Nuevamente, tomando el ejemplo anterior, vemos que:
Calculamos el coeficiente de variación de la siguiente forma:
En este caso, el coeficiente de variación nos indica que la dispersión es
regular, y la media es representativa.
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
CLASE 7
MEDIDAS DE POSICION
(Datos no agrupados)
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
Las medidas de posición dividen un conjunto de datos en grupos con el
mismo número de individuos.
Para el cálculo de estas medidas, es necesario que los datos estén
ordenados de menor a mayor.
Las medidas de posición son:
1. Cuartiles: Los cuartiles son los tres valores de la variable que
dividen a un conjunto de datos ordenados en cuatro partes iguales.
Q1, Q2 y Q3 determinan los valores correspondientes al 25%, al
50% y al 75% de los datos. Q2 coincide con la mediana.
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
2. Deciles: Los deciles son los nueve valores de la variable que
dividen a un conjunto de datos ordenados en diez partes iguales.
D1, D2, D3 …. D9 determinan los valores correspondientes al 10%,
20%, 30% …. y al 90% de los datos. D5 coincide con la mediana.
3. Percentiles: Los percentiles son los noventa y nueve valores de la
variable que dividen a un conjunto de datos ordenados en cien
partes iguales.
P1, P2, P3 …. P9 determinan los valores correspondientes al 1%,
2%, 3% …. y al 99% de los datos. P50 coincide con la mediana.
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
En el caso de los conjuntos de DATOS NO AGRUPADOS, nos
centraremos solamente en el cálculo de los cuartiles, ya que
normalmente tendremos una cantidad de datos pequeña, que no
nos permitiría diferenciar de manera más clara la ubicación de los
deciles y percentiles.
Para calcular los cuartiles en un conjunto de datos no agrupados,
básicamente tenemos 3 pasos:
1. Ordenar los datos de menor a mayor (si algún dato se repite, se
escribe todas las veces que se repita).
2. Calcular la posición de cada cuartil.
3. Calcular el valor de cada cuartil.
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
¿Qué significa la “posición” de cada cuartil? Supongamos que
tenemos el siguiente conjunto de datos: 15, 21, 22, 24, 30 (este conjunto
ya está ordenado de menor a mayor). En este caso, 15 ocupa la posición
1, 21 ocupa la posición 2, 22 ocupa la posición 3, 24 ocupa la posición 4
y 30 ocupa la posición 5.
Para calcular la posición de los cuartiles, primeramente debemos ver si
la cantidad de datos (n) es impar o es par.
Si n es impar: Si n es par:
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
Ejemplo 1. Las calificaciones obtenidas por 11 alumnos en una prueba
de estadística fueron: 92, 72, 63, 66, 64, 85, 85, 65, 72, 71 y 77. Vamos
a hallar e interpretar los cuartiles del conjunto de datos.
1er paso: Ordenamos los datos de menor a mayor: 63, 64, 65, 66, 71,
72, 72, 77, 85, 85, 92.
2do paso: Calculamos la posición de los cuartiles. Vemos que n = 11, es
decir, la cantidad de datos es impar. Entonces:
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
3er paso: Hallamos e interpretamos los cuartiles. Recordemos que
nuestro conjunto quedó ordenado de la siguiente forma:
63, 64, 65, 66, 71, 72, 72, 77, 85, 85, 92
Por tanto:
La interpretación es como sigue:
25% de los alumnos obtuvieron calificaciones menores o iguales que 65.
50% de los alumnos obtuvieron calificaciones menores o iguales que 72.
75% de los alumnos obtuvieron calificaciones menores o iguales que 85.
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
Ejemplo 2. Las edades de 12 individuos son: 20, 34, 40, 27, 50, 44, 38,
44, 48, 46, 30, 32. Vamos a hallar e interpretar los cuartiles del conjunto
de datos.
1er paso: Ordenamos los datos de menor a mayor: 20, 27, 30, 32, 34,
38, 40, 44, 44, 46, 48, 50.
2do paso: Calculamos la posición de los cuartiles. Vemos que n = 12, es
decir, la cantidad de datos es par. Entonces:
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
Como podemos ver, las posiciones no corresponden a números enteros,
pero esto lo dejamos así (no se redondea la posición de los cuartiles).
Que la posición de Q1 sea 3,5 significa que Q1 estará en el punto
medio entre los lugares 3 y 4.
Que la posición de Q2 sea 6,5 significa que Q2 estará en el punto
medio entre los lugares 6 y 7.
Que la posición de Q3 sea 9,5 significa que Q3 estará en el punto
medio entre los lugares 9 y 10.
3er paso: Hallamos e interpretamos los cuartiles. Recordemos que
nuestro conjunto quedó ordenado de la siguiente forma:
20, 27, 30, 32, 34, 38, 40, 44, 44, 46, 48, 50
Universidad Autónoma de Asunción Medidas de posición – Datos no agrupados
Por tanto:
Por tanto:
Por tanto:
La interpretación es como sigue:
25% de las edades de los individuos son menores o iguales que 31 años.
50% de las edades de los individuos son menores o iguales que 39 años.
75% de las edades de los individuos son menores o iguales que 45 años.