UNIDAD I
HERRAMIENTAS ESTADISTICAS
1.1 INTRODUCCIÓN A LA ESTADISTICA
ESTADÍSTICA
Es la rama de las matemáticas que examina las formas de analizar y procesar datos.
Mark L. Berenson - Estudio de los datos cuantitativos de la población, de los recursos naturales e
industriales, del tráfico o de cualquier otra manifestación de las sociedades humanas.
Diccionario de la real academia de la lengua española - Rama de la matemática que utiliza grandes
conjuntos de datos numéricos para obtener inferencias basadas en el cálculo de probabilidades.
APLICACIONES DE LA ESTADÍSTICA
La estadística puede presentarse en diferentes niveles de dificultad matemática y puede estar dirigida hacia
aplicaciones en distintos campos de la investigación. De acuerdo con esto, se han escrito muchos libros de texto
sobre estadística empresarial, estadística educativa, estadística médica, estadística psicológica,…, e inclusive sobre
estadística para historiadores.
Para quienes están en el área de la investigación de mercados, la estadística es de gran ayuda en el momento de
determinar qué tan probable es que un producto nuevo sea exitoso. La estadística también es muy útil para evaluar
las oportunidades de inversión por parte de asesores financieros. Los contadores, los jefes de personal, y los
fabricantes encuentran oportunidades ilimitadas de beneficiarse con el uso del análisis estadístico.
Incluso un investigador en el campo de la medicina, interesado en la efectividad de un nuevo medicamento,
considera la estadística una aliada imprescindible.
Así pues, la teoría general de la estadística es aplicable a cualquier campo científico en el cual se hacen
observaciones. El estudio y aplicación de los métodos estadísticos son necesarios en todos los campos del
conocimiento, sean éstos de nivel técnico o científico.
FUNCIONES DE LA ESTADÍSTICA
La estadística es la ciencia que tiene que ver con la (1) recolección, (2) organización, (3) presentación, (4) análisis,
e (5) interpretación de datos.
Aunque en todo estudio estadístico el primer paso es la recolección de datos, es usual en un curso básico de
estadística asumir que los datos ya han sido recolectados y que ahora están disponibles.
Por consiguiente, el trabajo comienza con el esfuerzo por organizar y presentar estos datos de manera significativa
y descriptiva. Los datos deben colocarse en un orden lógico que revele rápida y fácilmente el mensaje que
contienen.
Este procedimiento constituye el proceso de la estadística descriptiva, luego que los datos se han organizado y se
han presentado para su revisión, el estadístico debe analizarlos e interpretarlos. Estos procedimientos se basan en
la estadística inferencial y constituyen un importante beneficio para el análisis estadístico, mediante la ayuda en
el proceso de toma de decisiones y solución de problemas.
Toda empresa que se enfrenta a las presiones competitivas debe beneficiarse considerablemente de la capacidad
para anticipar las condiciones del negocio, antes de que éstas ocurran. Si una empresa sabe cómo van a estar sus
ventas en cierto momento en el futuro cercano, la gerencia puede hacer planes más exactos y efectivos respecto
a las operaciones actuales.
1
Si se calculan las ventas futuras con un grado de exactitud confiable, la gerencia puede tomar fácilmente decisiones
importantes respecto a los niveles de inventario, pedidos de materia prima, contrataciones de empleados y,
virtualmente, sobre cada aspecto de las operaciones del negocio.
CONCEPTOS BÁSICOS
Población (o universo)
Es el conjunto de todos los elementos cuyo conocimiento nos interesa y serán objeto de nuestro estudio.
Es la totalidad de elementos o cosas bajo consideración.
Por ejemplo:
Todos los empleados
Todos los productos
Todas las calificaciones
Muestra
Es un subconjunto, extraído de la población, cuyo estudio sirve para inferir características de toda la población
Es la porción de la población que se selecciona para su análisis.
Por ejemplo:
Los empleados de la empresa X (o del área Y)
Los productos de limpieza
Las calificaciones aprobatorias
Datos
Son medidas o valores susceptibles de ser observados y contados. Para hacer un análisis estadístico, es necesario
hacer una recopilación de datos.
Caracteres
Son los aspectos que deseamos estudiar. Cada carácter puede tomar distintos valores o modalidades. Una variable
estadística recorre todos los valores de un cierto carácter.
Variable
Es una característica de la población que se está analizando en un estudio estadístico; pueden ser:
Cuantitativas. Si pueden expresarse numéricamente. Se clasifican en variables discretas y continuas:
Si la variable puede tomar cualesquiera de todos los valores, teóricamente posibles, entre dos
valores dados es continua (Pueden tomar todos los valores de un intervalo)
En caso que pueda tomar sólo valores enteros se dice que la variable es discreta (Toman valores
numéricos aislados)
Ejemplos:
El peso de las personas (variable continua porque alguien puede pesar 70.85 Kg, es decir un valor
entre 70 y 71)
El número de habitantes por vivienda (variable discreta porque sólo se pueden utilizar números
enteros para contabilizar a las personas)
El ingreso monetario de las familias (variable continua porque también hay números
fraccionarios), etc.
2
- Cualitativas. Cuando no pueden ser medidas en un sentido numérico. No toman valores numéricos
Ejemplos:
Estado civil de las personas
Color de ojos
El sexo, etc.
Individuo
Es cada uno de los elementos que forman la población o la muestra.
RAMAS DE LA ESTADÍSTICA
• La estadística descriptiva: Trata de “describir” y analizar algunos caracteres de los individuos de un grupo dado,
sin extraer conclusiones para un grupo mayor. Para este estudio, se siguen estos pasos:
Selección de caracteres que interese estudiar.
Análisis de cada carácter: diseño de la encuesta o del experimento y recogida de datos.
Clasificación y organización de los resultados en tablas de frecuencias.
Elaboración de gráficos, si conviene, para divulgarlos a un público amplio (no experto).
Obtención de parámetros: valores numéricos que resumen la información obtenida.
• La estadística inferencial: Trabaja con muestras y pretende, a partir de ellas, “inferir” características de toda la
población. Es decir, se pretende tomar como generales propiedades que solo se han verificado para casos
particulares. En ese proceso hay que operar con mucha cautela: ¿Cómo se elige la muestra?, ¿Qué grado de
confianza se puede tener en el resultado obtenido?
1.2 ESTADÍSTICA DESCRIPTIVA
TABLAS DE FRECUENCIAS
Las tablas de frecuencias sirven para ordenar y organizar los datos estadísticos. Con ellas, una masa amorfa de
datos pasa a ser una colección ordenada y perfectamente inteligible. Con los datos se construye la tabla de
frecuencias:
En la primera columna, la variable xi , con todos sus posibles valores
En la segunda columna, la correspondiente frecuencia, fi: número de veces que aparece cada valor.
xi fi
21 4
22 1
23 1
25 1
26 1
39 1
3
FRECUENCIAS RELATIVAS
Cuando se desea comparar varias distribuciones similares con distinto número de elementos, se debe recurrir a
las frecuencias relativas. Estas vienen dadas en “tanto por uno” (fr) o en “tantos por ciento” (%). Si N es el número
de individuos:
fi 100 ∗ fri
fri = % = 100 ∗ fri =
N
N
Te sirve para representar que trozo de pastel ocupa la frecuencia absoluta que has calculado.
EJEMPLO:
Durante el mes de julio, en una ciudad se han registrado las siguientes temperaturas máximas:
32, 31, 28, 29, 33, 32, 31, 30, 31, 31, 27, 28, 29, 30, 32, 31, 31, 30, 30, 29, 29, 30, 30, 31, 30, 31, 34, 33, 33, 29, 29.
TABLA DE FRECUENCIA
xi fi
FRECUENCIA RELATIVA
xi fi fri % fri
FRECUENCIAS RELATIVAS ACUMULADAS (F)
En una distribución de frecuencias, se llama frecuencia relativa acumulada, Fi, correspondiente al valor i-ésimo, xi,
a la suma de la frecuencia de ese valor con todas las anteriores:
Fi = f1 + f2 + .... + fi
4
Fi
Fri =
N
% acum. = Fri x 100
CONTINUANDO CON EL EJEMPLO: FRECUENCIA RELATIVA ACUMULADA
xi fi fri % fri Fi Fi acumulada
Este tipo de tablas de frecuencias se utiliza con variables discretas
TABLAS CON DATOS A GRUPADOS
Cuando los valores de la variable son muchos, conviene agrupar los datos en intervalos o clases para así realizar
un mejor análisis e interpretación de ellos.
• Para construir una tabla de frecuencias con datos agrupados, conociendo los intervalos, se debe determinar la
frecuencia absoluta (fi) correspondiente a cada intervalo, contando la cantidad de datos cuyo valor está entre los
extremos del intervalo. Luego se calculan las frecuencias relativas y acumuladas, si es pertinente.
• Si no se conocen los intervalos, se pueden determinar de la siguiente manera: (recuerda que los intervalos de
clase se emplean si las variables toman un número grande de valores o la variable es continua).
- Se busca el valor máximo de la variable y el valor mínimo. Con estos datos se determina el rango.
- Se divide el rango en la cantidad de intervalos que se desea tener (por lo general se determinan 5 intervalos de
lo contrario es ideal que sea un número impar por ejemplo 5, 7, 9) obteniéndose así la amplitud o tamaño de cada
intervalo.
- Comenzando por el mínimo valor de la variable, que será el extremo inferior del primer intervalo, se suma a este
valor la amplitud para obtener el extremo superior y así sucesivamente.
• Otra forma de calcular la cantidad de intervalos es aplicando los siguientes métodos:
Método Sturges: k = 1 + 3,332 log n
donde:
k= número de clases
n= tamaño muestral
5
Debemos tener en cuenta 2 cosas. Primero, que el número de intervalos me tiene que dar impar; segundo, que el
resultado se redondea generalmente a la baja. Si al redondear a la baja nos da como resultado un número par
debemos redondear al alza. Este es el método que tiene mayor precisión.
Método Empírico: este método depende del criterio del evaluador de los datos, por lo tanto, es arbitrario. Dice lo
siguiente.
5 ≥ k ≥ 20
EJERCICIO:
En un centro comercial, se consultó la edad a todas las personas que entraban entre las 12:00 h y 12:30 h. Los
resultados obtenidos fueron los siguientes:
- Construye una tabla de frecuencias cuyos datos estén agrupados en 8 intervalos.
1° Para poder construir la tabla de frecuencias lo primero que debemos hacer es calcular el rango.
El rango da la idea de proximidad de los datos a la media. Se calcula restando el dato menor al dato mayor.
Dato mayor - dato menor =
Por lo tanto; Rango =
2° En el problema nos dicen que debemos agruparlo en 8 intervalos o clases, con este dato podemos calcular la
amplitud o tamaño de cada intervalo, dividiendo el valor del rango por la cantidad de intervalos que se desean
obtener (en este caso son 8).
Amplitud: La amplitud de un intervalo es la diferencia entre el límite superior y el límite inferior. La amplitud(A)
de los intervalos puede calcularse mediante la expresión:
6
Amplitud = =
Por lo tanto la amplitud de cada intervalo será de _______ 9
- El valor de la amplitud se redondea al número inmediato superior de acuerdo a la cantidad de decimales que
tienen los datos o según la precisión con que se desea trabajar.
- Puede haber intervalos con distinta amplitud.
- Puede haber intervalos con amplitud indefinida (intervalos abiertos)
3° Ahora podemos comenzar a construir la tabla de frecuencias:
Hay distintas formas de construir los intervalos dependiendo del tipo de variable que estemos trabajando.
a) Variables cuantitativas discretas: solo pueden tomar un número finito de valores. Siendo por lo general estos
valores los números naturales 1, 2, 3...
Un ejemplo son el número de hijos, el número de habitaciones de una vivienda, el número de matrimonios de una
persona.
Cuando categorizamos variables discretas los límites de clase son idénticos a los límites reales. Por ejemplo, el
número de personas que viven en una familia podemos agruparlo, De 1 hasta 2 (0 es imposible no hay ninguna
familia sin ningún miembro) De 3 hasta 4, De 5 hasta 7.
b) Variables cuantitativas continuas: Las variables continuas, por el contrario, pueden, tomar un número infinito
de valores en cualquier intervalo dado.
En este caso los valores se agrupan en intervalos cuyos límites inferior y superior serían los siguientes:
Inferior: Lii
Superior: Lsi-1
Habitualmente, los intervalos se consideran cerrados a la izquierda y abiertos a la derecha, es decir que el extremo
inferior está incluido en el intervalo, pero el extremo superior no.
Es importante mencionar que las clases o intervalos para las variables continuas pueden ser de tres tipos:
Abiertas: clases abiertas tienen límites determinados (a,b), pero los valores que la contienen comprenden valores
muy cercanos a estos límites sin comprenderlos a ellos mismos, esto se representa con un intervalo definido entre
paréntesis (). Esto quiere decir que esta clase contiene valores desde a hasta b pero no contiene exactamente a ni
b solo valores muy cercanos. (1, 10)
Cerradas: las clases cerradas, además de los valores que están entre a y b, los contiene a ellos, y se representa con
corchetes [a,b].
Semiabiertas: pueden contener a o b más los valores que están entre ellos, y se puede representar con un corchete
y un paréntesis, por ejemplo, (a,b], en este caso no contiene el valor a y si los valores de b, además de los valores
que están entre estos.
7
Se construye la tabla con el último método explicado.
Intervalo Edades Frecuencia Frecuencia Frecuencia Frecuencia relativa
absoluta (fi) relativa (fri) % acumulada (Fi) acumulada
1 1-10
2 11-20
3 21-30
4 31-40
5 41-50
6 51-60
7 61-70
8 71-80
- Marca clase o centro de la clase: es la semisuma de los límites de cada clase. Representa a todos los datos que
están contenidos en una clase. (punto medio de cada intervalo)
Responder las siguientes preguntas:
a) Del total de personas encuestadas, ¿cuántas personas tienen entre 31 y 40 años?
Respuesta: Observamos los datos obtenidos en la tabla y tenemos que el dato lo obtenemos de la columna de la
frecuencia absoluta.
Por lo tanto, la respuesta es _______ personas.
b) Del total de personas encuestadas, ¿cuántas personas tienen 60 o menos años?
Respuesta: Observamos los datos obtenidos en la tabla y tenemos que el dato lo obtenemos de la columna de
frecuencia absoluta acumulada.
En este caso es el intervalo ________. Por lo tanto, la respuesta es ___________ personas tienen 60 o menos años.
c) ¿Cuál es la probabilidad de, que al elegir al azar a una persona consultada, esta tenga entre 11 y 20 años?
Respuesta: Observamos los datos obtenidos en la tabla y tenemos que el dato lo obtenemos de la columna de
frecuencia relativa.
En este caso es el intervalo ________________, ya que es ahí donde se encuentran las edades entre
_____________.
Entonces La probabilidad es _________________.
Por último, vamos a repasar el concepto de:
Frecuencia relativa acumulada (Hi), Es la probabilidad de observar un valor menor o igual al valor que toma la
variable en estudio en ese intervalo.
8
Se calcula dividiendo Fi por el número total de datos. También puedes calcularlo Sumando la frecuencia relativa
de cada grupo con la frecuencia relativa acumulada del grupo anterior.
Si haces correctamente estos cálculos, el último grupo tendrá una frecuencia acumulada de 1, o muy cerca de 1,
permitiendo redondear el error.
Recuerda que este valor se puede expresar como porcentaje, ¡para esto solo debes multiplicar el valor obtenido
por 100 y listo!!!
Este cálculo te sirve en el caso de que te pregunten:
d) Si le preguntas a una persona cualquiera ¿Cuál es la probabilidad de que tenga 50 años o menos?
Respuesta: La probabilidad es de un ________________
1.3 GRÁFICOS ESTADÍSTICOS DE CONTROL
GRAFICOS PARA VARI ABLES CUALITATIVAS
- Diagrama de barras:
En el eje de las X: Se representan los valores de la variable
En el eje de las Y: Se representan los valores de la frecuencia: f, fr ó %
Se levanta para cada valor de la X una barra que representa la frecuencia de dicho valor.
Si unimos mediante una poligonal los puntos más altos de cada barra obtenemos el polígono de frecuencias.
- Diagrama de sectores:
Se dibuja un círculo y los porcentajes correspondientes a cada valor (Para dibujar los sectores conviene
hacerlo a partir del % acumulado, pues facilita el trabajo).
GRAFICOS PARA VARI ABLES CUANTITATIVAS DISCRETAS
- Diagrama de barras y polígono de frecuencias:
Como en las cualitativas.
- Diagrama de barras acumuladas:
Como en los diagramas de barras, pero en el eje OY se toman los valores de las frecuencias acumuladas
(Fi, Fri o % acum).
Si unimos mediante una poligonal los puntos más altos de cada barra obtenemos el polígono de
frecuencias acumuladas.
- Diagrama de sectores:
Como en las cualitativas
9
GRAFICOS PARA VARI ABLES CUANTITATIVAS CONTINUAS
SI TODOS LOS INTERVALOS TIENEN LA MISMA AMPLITUD
- Histograma:
En el eje de las X: Se representan los valores de la variable
En el eje de las Y: Se representan los valores de la frecuencia: f, fr ó %
Se levanta para cada valor del intervalo de la X un rectángulo de altura la frecuencia de dicho intervalo.
Si unimos mediante una poligonal los puntos medios más altos de cada uno de dichos rectángulos obtenemos
el polígono de frecuencias.
- Diagrama de barras acumuladas:
En el eje de las X: Se representan los valores de la variable
En el eje de las Y: Se representan los valores de la frecuencia acumulada: F, Fr ó %
Se levanta para cada valor del intervalo de la X un rectángulo de altura la frecuencia acumulada de dicho
valor.
Si unimos mediante una poligonal las diagonales de dichos rectángulos obtenemos el polígono de frecuencias
acumuladas.
- Diagrama de sectores:
Como en las cualitativas
SI LOS INTERVALOS NO SON TODOS DE LA MISMA AMPLITUD
- En los histogramas, en el eje de las Y, en vez de representar la frecuencia se representa la densidad de frecuencia:
fi
di =
ai
Siendo ai la amplitud de dicho intervalo, para que así la frecuencia coincida con el área del rectángulo.
- Los histogramas acumulados y los diagramas de sectores, iguales.
10