Probabilidad y Estadística
Instituto Tecnológico de Cancún
Unidad 1: Estadística descriptiva
Carrera: ingeniería civil
Shophia Madalena Huan Koo
2°A
06/02/2025
Probabilidad y estadística
Introducción
En este documento se explicara cuáles son las herramienta importante para entender
la estadística descriptiva como aplicarlas de formar efectiva y precisas para recopilar,
analizar, interpretar y presentar datos en relación con estudios, para esto debemos
entender los conceptos principales que son la base de un análisis estadístico sólido
que comienza con la población, que es la población y una muestra aleatoria, como
se subdivide al igual como obtener datos para ser analizados y estudiados, aplicando
las medidas de tendencia central y dispersión de manera adecuada , aprendiendo a
si mismo a usar diferentes formas para expresar de manera grafica los resultados de
análisis y estudios usando tablas de distribución de frecuencias gráficos, diagramas
entre otros así mismo en este documento podrá encontrar algunos softwares que
podrían ser útil para el estudio de la estadística y la probabilidad.
1.1 Población y muestra aleatoria
Población
La población son los de elementos que se desean estudiar, es decir, un conjunto de
individuos, artículos o sujetos que comparten características comunes y son el centro
de atención de un estudio.
• Población finita: población cuyo número de elementos es finito, es decir, se
pueden contar.
Ejemplo
Los alumnos de una clase
• Población infinita: población cuyo número de elementos es infinito, esto es,
que no tiene fin.
Ejemplo
Todas las estrellas en el universo
Muestra
Una muestra es una parte de la población y es el grupo de individuos que son
estudiados.
• Simple: El muestreo es un método de selección de muestra en el que todos
los elementos de la población tienen la misma probabilidad de ser elegidos.
Ejemplo
Seleccionar al azar 10 estudiantes de una clase de 50 alumnos.
• Estratificado: es un método de selección de muestra en el que la población
se divide en grupos o estratos homogéneos, y luego se selecciona una muestra
aleatoria de cada estrato. La población se divide en subgrupos que comparten
características similares, como edad, género, nivel socioeconómico, etc.
Luego, de cada subgrupo se selecciona una muestra aleatoria de manera
proporcional a su tamaño dentro de la población total.
Ejemplo
Dividir una población de clientes de un banco por nivel de ingresos (bajo,
medio, alto) y luego seleccionar una muestra aleatoria proporcional de cada
grupo.
• Sistemático: el muestreo sistemático es un método de selección de
muestra en el que el primer elemento se elige de forma aleatoria y los
siguientes se eligen siguiendo un patrón o sistema.
Ejemplo
Seleccionar cada 5º cliente que entra a una tienda, empezando por un
cliente elegido al azar.
1.2 Obtención de datos estadísticos
La obtención de datos estadísticos es el proceso mediante el cual se recopilan,
organizan y procesan informaciones relevantes sobre un fenómeno o una población
específica. Este proceso permite obtener datos cuantificables que pueden ser
analizados e interpretados para extraer conclusiones.
• Encuestas: Se utilizan para recopilar información directamente de los
participantes a través de cuestionarios.
• Experimentos: Consisten en realizar pruebas controladas para observar y
registrar los efectos y variables que se producen.
• Observaciones: Implican registrar y anotar los comportamientos o
características que se observan directamente.
• Fuentes secundarias: Consisten en utilizar datos previamente recopilados
por otras investigaciones o entidades.
Ejemplo
1. Definir el objetivo: Conocer la edad promedio de los estudiantes.
2. Seleccionar la muestra: Elegir al azar 50 estudiantes.
3. Recopilar datos: Preguntar la edad a cada estudiante.
4. Calcular el promedio: Sumar todas las edades y dividir entre 50.
5. Interpretar resultados: Analizar si el promedio es representativo.
1.3 Medias de tendencia central
Las medidas de tendencia central, o medidas de centralización, son métricas
estadísticas que indican el valor central de una distribución. Es decir, las medidas de
tendencia central sirven para encontrar un valor representativo del centro de un
conjunto de datos.
• Media (promedio): Es el valor que resulta de dividir la suma de todos los datos
entre el número total de datos.
Media de 9,7,5,8,7.5
• Mediana: Es el valor central cuando los datos se ordenan de menor a mayor.
Si hay un número par de datos, la mediana es el promedio de los dos valores
centrales.
Par
Impar
Calcula la mediana de los siguientes datos: 3, 4, 1, 6, 7, 4, 8, 2, 8, 4, 5
Lo primero que debemos hacer antes de realizar ningún cálculo es ordenar los
datos
En este caso tenemos 11 observaciones, así que el número total de datos es
impar. Por lo tanto, aplicamos la siguiente fórmula para calcular la posición de
la mediana:
De manera que la mediana será aquel dato que está en la sexta posición, que
en este caso corresponde al valor 4.
• Moda: Es el valor que aparece con mayor frecuencia en el conjunto de datos.
¿Cuál es la moda del siguiente conjunto de datos?
Los números 2 y 9 aparecen dos veces, pero el número 5 está repetido tres
veces. Por lo tanto, la moda de la serie de datos es el número 5.
1.4 Medidas de dispersión
Las medidas de dispersión son unas métricas estadísticas que indican la dispersión
de un conjunto de datos. Es decir, las medidas de dispersión se utilizan para evaluar
cuánto de dispersos están los datos de una muestra.
• Desviación estándar (o desviación típica): Es la raíz cuadrada de la
varianza, y representa la dispersión promedio de los datos respecto a la media.
Calcula
la
desviación estándar de los siguientes valores: 3, 6, 2, 9, 4.
Ahora usamos la fórmula de la desviación estándar:
Sustituimos los datos en la fórmula:
• Varianza: Es el promedio de los cuadrados de las desviaciones respecto a la
media. Mide cuánto se dispersan los datos en relación a la media.
Calcula la varianza de este conjunto de datos:11, 5, 2, -9, 7
Utilizar la fórmula de la varianza:
Sustituimos los datos:
• Coeficiente de variación: Es el cociente entre la desviación estándar y la
media. Permite comparar la dispersión de diferentes conjuntos de datos.
Calcula el coeficiente de variación del siguiente conjunto de datos estadísticos:
4, 1, 3, 9, 12, 2, 5, 8, 3, 6
En primer lugar, debemos calcular la desviación típica de la serie datos:
Luego calculamos la media aritmética del conjunto de datos:
Una vez sabemos la desviación típica y el promedio de los datos, simplemente
tenemos que utilizar la fórmula del coeficiente de variación para encontrar su
valor:
De modo que sustituimos los valores calculados en la fórmula y hacemos el
cálculo del coeficiente de variación:
• Rango: Es la diferencia entre el valor más alto y el valor más bajo de un
conjunto de datos.
Ejemplo
• Desviación media: Es el promedio de las desviaciones absolutas de los datos
respecto a la media.
2, 3, 7 y 5 millones de dólares. ¿Cuál es la desviación media de los datos?
Utilizamos la fórmula de la desviación media:
Sustituimos los datos en la fórmula:
1.5Tabla de distribución de frecuencias
Una tabla de frecuencias organiza un conjunto de datos en diferentes categorías y
muestra varios tipos de frecuencias. Los componentes principales son:
• Frecuencia Absoluta (f): Número de veces que aparece un valor en el
conjunto de datos.
• Frecuencia Absoluta Acumulada (F): Suma de las frecuencias absolutas
hasta un determinado valor.
• Frecuencia Relativa (h): Proporción de la frecuencia absoluta con respecto al
total de datos (f/n, donde n es el total).
• Frecuencia Relativa Acumulada (H): Suma de las frecuencias relativas hasta
un determinado valor.
1.6 Cuantiles
Los cuantiles son puntos que dividen un conjunto de datos ordenados en partes
iguales. Indican el valor por debajo del cual se encuentra un porcentaje específico de
los datos.
Para calcular la posición de un cuantil de un conjunto de datos estadísticos debes
multiplicar el número del cuantil por la suma del número total de datos más uno.
Por ejemplo, si el valor del cuantil de orden 0,39 es 24, significa que el 39% de los
datos de la muestra son menores que 24 y que el resto de datos son mayores que
24.
• Cuartiles: Dividen los datos en cuatro partes.
a) Q1: 25% de los datos están por debajo.
b) Q2: 50% de los datos (mediana).
c) Q3: 75% de los datos están por debajo.
• Deciles: Dividen los datos en diez partes.
a) D1: 10% de los datos están por debajo.
b) D2: 20% de los datos están por debajo.
c) Y así sucesivamente hasta D9.
• Percentiles: Dividen los datos en cien partes.
a) P1: 1% de los datos están por debajo.
b) P50: 50% de los datos (mediana).
c) P99: 99% de los datos están por debajo.
Calcula los tres cuartiles del siguiente conjunto de datos:
1.7 Gráficos
Un gráfico estadístico es una representación gráfica de un conjunto de datos
estadísticos. Estos gráficos permiten resumir y analizar visualmente una muestra de
datos, facilitando la comprensión y la interpretación de la información.
• Gráfico de Barras: Representa cantidades en barras verticales u horizontales.
• Gráfico de Líneas: Muestra la evolución de datos a lo largo del tiempo.
• Gráfico Circular (Pastel): Representa proporciones de un todo.
• Histograma: Muestra la distribución de frecuencias de un conjunto de datos
continuos.
1.8 Cajas y alambres
Los gráficos de cajas y alambres (también conocidos como boxplots) son
herramientas gráficas utilizadas en estadística para representar la distribución de un
conjunto de datos. Son especialmente útiles para visualizar la mediana, los cuartiles
y los valores atípicos.
Componentes del Gráfico de Cajas
• Caja: Representa el rango intercuartílico (IQR), que es la distancia entre el
primer cuartil (Q1) y el tercer cuartil (Q3). La caja contiene el 50% central de
los datos.
• Línea Mediana: Una línea dentro de la caja que indica la mediana (Q2) del
conjunto de datos.
• Bigotes (Alambres): Extensiones que se extienden desde la caja hasta el valor
mínimo y máximo dentro de 1.5 veces el IQR. Los puntos fuera de este rango
se consideran valores atípicos.
• Valores Atípicos: Puntos que se encuentran fuera de los bigotes,
representados generalmente como puntos individuales.
Como graficar un diagrama de caja y alambre
1. Ordenar los datos de la muestra estadística.
2. Calcular los cuartiles (Q1, Q2 y Q3) y representarlos como la caja del
diagrama. El primer y el tercer cuartil corresponden a los límites de la caja,
y para representar la mediana (el segundo cuartil) se debe dibujar una línea
dentro de la caja donde se encuentre su valor.
3. Calcular el rango intercuartílico, que es igual al tercer cuartil menos el
primer cuartil.
4. Calcular los valores admisibles LI y LS, cuyas fórmulas son:
5. Identificar los valores atípicos de la muestra, que son aquellos valores
menores que LI o mayores que LS. Representar dichos valores fuera del
alcance de los bigotes con puntos.
6. Identificar y representar los valores extremos, que és el valor más pequeño
y el valor más grande dentro del intervalo formado por LI y LS. Estos valores
son el final de los dos bigotes del diagrama.
Ejemplo
Realiza el diagrama de caja y bigotes (o boxplot) del siguiente conjunto de
datos estadísticos.
En segundo lugar, sacamos los cuartiles de la muestra:
Ahora calculamos los límites LI y LS, que son los valores a partir de los cuales
se considera que un dato es atípico. Para ello, debemos utilizar las siguientes
fórmulas:
De modo que en este caso tenemos dos valores atípicos, porque 3,02 es
menor que 3,16 y 5,71 es mayor que 5,56.
Ubicar mínimo y máximo
Representar atreves de la gráfica de caja y alambre
1.9 Diagrama de Pareto
El diagrama de Pareto es un gráfico estadístico que representa un conjunto de datos
mediante barras dispuestas en orden descendente representan gráficamente los
porcentajes acumulados utilizando un polígono de frecuencias.
El diagrama de Pareto también se conoce como curva cerrada o distribución A-B-C y
fue inventado por el economista italiano Vilfredo Pareto.
Pasos para Hacer un Diagrama de Pareto
1. Recolectar los Datos:
a. Reúne los datos estadísticos relevantes del problema que deseas
analizar.
2. Ordenar los Valores:
a. Organiza los datos según su frecuencia absoluta de manera
descendente, comenzando por la mayor frecuencia.
3. Calcular el Porcentaje:
a. Para cada categoría, divide la frecuencia absoluta entre el número
total de datos y multiplica por 100 para obtener el porcentaje.
4. Determinar el Porcentaje Acumulado:
a. Suma el porcentaje de cada categoría con todos los porcentajes
anteriores para obtener el porcentaje acumulado.
5. Representar Gráficamente:
a. Crea un gráfico donde las frecuencias absolutas se representen con
barras y los porcentajes acumulados con un polígono de frecuencias.
Para un estudio estadístico sobre las ventas de ordenadores, se ha
preguntado a una muestra de 50 personas cuál es el principal motivo por el
que compran un ordenador y los resultados se han registrado en la siguiente
tabla de datos. Construye un diagrama de Pareto con las respuestas de los
encuestados.
Las frecuencias absolutas se representan mediante barras rectangulares, mientras
que los porcentajes acumulados se representan mediante un polígono de frecuencias.
1.10 Uso de software
La hoja de cálculo Excel/Calc es una herramienta poderosa para enriquecer el
aprendizaje en estadística y probabilidad. A continuación, se detallan sus principales
características y beneficios:
Funcionalidades de Excel/Calc
Facilita la representación visual de datos mediante gráficos.
1. Cálculos Estadísticos:
Permite calcular:
i. Media
ii. Moda
iii. Mediana
iv. Varianza
v. Desviación típica
2. Gráficos:
Soporta diversos tipos de gráficos que ayudan en la comprensión de los
datos.
3. Análisis de Datos:
Incluye un comando para el análisis de datos dentro de las "herramientas
para el análisis", aunque su uso es poco común.
Minitab
• Análisis Estadístico: Minitab ofrece herramientas para realizar análisis
descriptivos, como medias y desviaciones estándar, así como análisis
inferenciales, como pruebas t y análisis de varianza (ANOVA). También se
utiliza para modelos de regresión y análisis multivariado.
• Visualización de Datos: Proporciona gráficos interactivos como histogramas,
diagramas de caja y gráficos de dispersión para explorar y visualizar los datos.
• Análisis de Calidad: Se utiliza ampliamente en la industria para análisis de
control de calidad y gráficos de control.
JMP
• Modelado Estadístico: JMP incluye herramientas para regresión, análisis de
varianza (ANOVA), y análisis de series temporales. Permite realizar análisis de
supervivencia y modelado predictivo.
• Exploración de Datos: Ofrece capacidades de visualización interactiva para
explorar patrones y tendencias en los datos, utilizando gráficos dinámicos.
• Pruebas de Hipótesis: Facilita la realización de pruebas estadísticas para
comparar grupos y determinar significancia estadística.
Statistica
• Análisis Descriptivo e Inferencial: Statistica proporciona un amplio rango de
herramientas para realizar estadísticas descriptivas como promedios,
medianas y desviaciones estándar, así como pruebas de hipótesis y análisis
inferenciales.
• Modelos Predictivos: Incluye técnicas avanzadas para el modelado
predictivo, como redes neuronales y análisis de regresión.
• Minería de Datos: Ofrece herramientas para la minería de datos, incluyendo
clustering y árboles de decisión, permitiendo descubrir patrones ocultos en
grandes conjuntos de datos.
Conclusión
En conclusión, este documento proporciona una guía integral sobre las herramientas
esenciales para comprender y aplicar la estadística descriptiva de manera efectiva y
precisa. Se abordan conceptos fundamentales, como la población y la muestra
aleatoria, que aseguran la representatividad y fiabilidad de los datos recopilados. La
obtención de datos se discute como un paso crucial, destacando la importancia de su
calidad y representatividad. Además, se exploran las medidas de tendencia central
(media, mediana y moda) y medidas de dispersión (rango, varianza y desviación
estándar) para analizar y entender los datos adecuadamente. La representación
gráfica de los resultados es enfatizada a través de tablas de distribución de
frecuencias, gráficos y diagramas que facilitan la interpretación y presentación de los
datos. También se presenta el diagrama de Pareto, útil para identificar y priorizar
problemas significativos en un proceso. Asimismo, se incluye una revisión de software
estadístico que ofrecen herramientas avanzadas para realizar análisis complejos y
obtener resultados precisos. En conjunto, este documento busca equipar al lector con
las herramientas y conocimientos necesarios para realizar un análisis estadístico
sólido y tomar decisiones informadas basadas en datos, destacando la importancia
de la estadística descriptiva en el análisis de estudios y la interpretación de
información.
Bibliografía
• Probabilidad y Estadística. (n.d.). Medidas de tendencia central. Recuperado
de [Link]
• Probabilidad y Estadística. (n.d.). Ejemplo del cálculo de la desviación media.
Recuperado de [Link]
media/#ejemplo-del-calculo-de-la-desviacion-media
• Concepto Ejemplo. (n.d.). Concepto de recopilación de datos en estadística.
Recuperado de [Link]
datos-en-
estadistica/#Que_se_entiende_por_recopilacion_de_datos_en_estadistica
• Electroonica. (2013). Obtención de datos estadísticos. Recuperado de
[Link]
[Link]
• Evoluciona Pro. (n.d.). Obtención de datos estadísticos. Recuperado de
[Link]
• Clasificación de. (n.d.). Tipos de muestra. Recuperado de
[Link]
muestra/#:~:text=Esta%20muestra%20es%20seleccionada%20de%20maner
a%20f,ero%20el%20resto%20sigue%20a%20un%20sistema%20u%20orden
• Probabilidad y Estadística. (n.d.). Medidas de tendencia central. Recuperado
de [Link]
• Probabilidad y Estadística. (n.d.). Medidas de tendencia central. Recuperado
de [Link]
• Probabilidad y Estadística. (n.d.). Gráfico estadístico. Recuperado de
[Link]
• Feszesta. (n.d.). Diagrama de cajas y bigotes (box plot). Recuperado de
[Link]
• Probabilidad y Estadística. (n.d.). Diagrama de caja y bigotes (boxplot).
Recuperado de [Link]
bigotes-boxplot/
• Probabilidad y Estadística. (n.d.). Diagrama de Pareto. Recuperado de
[Link]
• Statistics Easily. (n.d.). ¿Qué es el software estadístico? Guía completa.
Recuperado de [Link]
es-el-software-estad%C3%ADstico%3F-Gu%C3%ADa-
completa/#google_vignette
• Electroonica. (2013). Uso de software. Recuperado de
[Link]
• Probabilidad y Estadística. (n.d.). Tabla de frecuencias. Recuperado de
[Link]
• Probabilidad y Estadística. (n.d.). Cuantiles. Recuperado de
[Link]
• Moya Navarro, M., & Robles Obando, N. (2010). Probabilidad y estadística: Un
enfoque teórico-práctico (Ebook). Instituto Tecnológico de Costa Rica.
• Alea Riera, V., Jiménez Garrido, E., Muñoz Vaquer, C., & Viladomiu Canela,
N. (Año). Estadística I: Teoría y ejercicios. Editorial/Institución.
• Salvarrey, L. (Año). Curso de estadística básica. Editorial/Institución.
• Pierdant, I., & Rodríguez, J. (Año). Elementos básicos de estadística.
Editorial/Institución.