ManualEst
Villar Carranza Diana Cecilia
2023-01-18
CAPITULO 1 Descripción de datos por medio de gráficas
1.1 VARIABLES Y DATOS
Una variable es una característica que cambia o varía con el tiempo o para diferentes personas u objetos en
estudio.
Una unidad experimental es el individuo u objeto en el que se mide una variable. Resulta una sola
medición o datos cuando una variable se mide en realidad en una unidad experimental.
Una población es el conjunto de mediciones de interés para el investigador.
Una muestra es un subconjunto de mediciones seleccionado de la población de interés.
1.2 TIPOS DE VARIABLES
Las variables cualitativas miden una cualidad o característica en cada unidad experimental. Las variables
cuantitativas miden una cantidad numérica en cada unidad experimental.
Una variable discreta toma sólo un número finito o contable de valores. Una variable continua puede
tomar infinitamente muchos valores correspondientes a los puntos en un intervalo de recta.
1.3 GRÁFICAS PARA DATOS CATEGÓRICOS y 1.4 GRÁFICAS PARA
DATOS CUANTITATIVOS
Cuando la variable de interés es cualitativa o categórica, la tabla estadística es una lista de las categorías
incluidas junto con una medida de la frecuencia con que se presenta cada valor. Es posible medir “la frecuencia”
en tres formas diferentes:
• La frecuencia o número de mediciones en cada categoría
• La frecuencia relativa o proporción de mediciones en cada categoría
• El porcentaje de mediciones en cada categoría
F recuencia
F recuenciarelativa = n
P orcentaje = 100 ∗ F recuenciarelativa
Grafica de pastel
frecuencias<- c(35,260,93,12) #frecuencias ejemplo
etiquetas <- paste0(round(100 * frecuencias/sum(frecuencias), 2), "%")
#Se hace el calculo para que las etiquetas muestren el porcentaje de frecuencias
pie(frecuencias, labels = etiquetas, main="Grafica de pastel ejemplo")
1
Grafica de pastel ejemplo
65%
8.75%
3%
23.25%
#la funcion pie desplega una grafica de pastel
Grafica de barras
frecuencias<- c(35,260,93,12) #frecuencias ejemplo
# Gráfico de barras de frecuencia absoluta
mi_tabla <- table(frecuencias)
barplot(mi_tabla, main = "Frequencia absoluta",col = rainbow(3))
Frequencia absoluta
1.0
0.8
0.6
0.4
0.2
0.0
12 35 93 260
# Gráfico de barras de frecuencia relativa
barplot([Link](mi_tabla) * 100, main = "Frequencia relativa (%)",col = rainbow(3))
2
25
20
15
10
5
0 Frequencia relativa (%)
12 35 93 260
Grafico de lineas
plot(frecuencias, type = "l", main= "Grafico de lineas", col="blue" )
Grafico de lineas
250
200
frecuencias
150
100
50
1.0 1.5 2.0 2.5 3.0 3.5 4.0
Index
3
#Se convierte en grafico de lineas modificando el type
Grafico de tallo y hojas
datos <- c(90,70,70,70,75,70,65,68,60,74,70,95,75,70,68,65,40,65,70)
#Base de datos de ejemplo
stem(datos, scale=2)
##
## The decimal point is 1 digit(s) to the right of the |
##
## 4 | 0
## 5 |
## 6 | 055588
## 7 | 0000000455
## 8 |
## 9 | 05
#stem es la funcion para grafica de tallo y hojas
Histograma de frecuencia
hist(datos, main= "Histograma de frecuencia")
Histograma de frecuencia
12
10
8
Frequency
6
4
2
0
40 50 60 70 80 90 100
datos
#La funcion para histograma es hist
4
CAPITULO 2 Descripción de datos con medidas numéricas
DESCRIPCIÓN DE UN CONJUNTO DE DATOS CON MEDIDAS NUMÉRI-
CAS
Las mediciones descriptivas numéricas asociadas con una población de mediciones se llaman parámetros;
las calculadas a partir de mediciones muestrales reciben el nombre de estadísticas.
MEDIDAS DE CENTRO
La media aritmética o promedio de un conjunto de n mediciones es igual a la suma de las mediciones
dividida entre n.
P
xi
M ediamuestral : x = n
La mediana m de un conjunto de n mediciones es el valor de x que cae en la posición media cuando las
mediciones son ordenadas de menor a mayor.
La moda es la categoría o el valor de x que se presenta con más frecuencia.
datos <- c(8, 5, 6, 7, 9, 6, 9, 8, 7, 10, 7, 5, 9, 8, 6)
mean(datos)
## [1] 7.333333
datos <- c(8, 5, 6, 7, 9, 6, 9, 8, 7, 10, 7, 5, 9, 8, 6)
median(datos)
## [1] 7
datos <- c(8, 5, 6, 7, 9, 6, 9, 8, 7, 10, 7, 5, 9, 8, 6)
mode(datos)
## [1] "numeric"
Medidas de variabilidad
Rango, es la diferencia entre la medicion mas grande y la mas pequeña de un conjunto de n mediciones
Varianza es la suma de las desviaciones cuadradas de las mediciones alrededor de la media dividida entre
(n-1)
Desviacion estandar es el valor x menos la media
datoss <- c(5,7,1,2,4)
range(datoss)#rango de los datos
## [1] 1 7
var(datoss)#Varianza de los datos
## [1] 5.7
sd(datoss)#Desviacion estandar de los datos
## [1] 2.387467
Teorema de Chebyshev
Dado un número k mayor que o igual a 1 y un conjunto de n mediciones, al menos [1 (1/kˆ2)] de las mediciones
estarán dentro de k desviaciones estándar de su media.
5
• Al menos ninguna de las mediciones está en el intervalo µ − σ a µ + σ. contiene aprox, 68% de las mediciones
• Al menos 3/4 de las mediciones están en el intervalo 2µ − 2σ a 2µ + 2σ. contiene aprox, 95% de las
mediciones
• Al menos 8/9 de las mediciones están en el intervalo 3µ − 3σ a 3µ + 3σ. contiene aprox, 99.7% de las
mediciones
MEDICIONES DE POSICIÓN RELATIVA
El puntaje z muestral es una medida de posición relativa definida por
x−x
puntajez = s
Un puntaje z mide la distancia entre una observación y la media, medidas en unidades de
desviación estándar.
Grafica de caja
Los elementos que componen la grafica de caja es la mediana, los cuartiles superior e inferior y el IQR para el
conjunto de datos
datosss<-c(340, 300, 520, 340, 320, 290, 260, 330)
boxplot(datosss, horizontal = TRUE, main= "grafica de caja")
grafica de caja
250 300 350 400 450 500
CAPITULO 3 Descripcion de datos bivariados
Graficas de dispersion para dos variables cuantitativas
x<- c(10, 11, 12, 13, 14)
y<- c(23.1, 19.18, 15.17, 19.20, 25.24)
plot(x,y, main= "Grafica de dispersion de ejemplo")
6
Grafica de dispersion de ejemplo
24
22
20
y
18
16
10 11 12 13 14
Recta de regresion
s
las rectas corresponden a una formula general y = a + bx donde b = r( sxy ) y a = y − bx
x<- c(10, 11, 12, 13, 14)
y<- c(23.1, 19.18, 15.17, 19.20, 25.24)
plot(x,y, main= "Grafica de dispersion de ejemplo")
abline(lm(y~x))
#La recta de regresion graficada
summary(lm(y~x))
##
## Call:
## lm(formula = y ~ x)
##
## Residuals:
## 1 2 3 4 5
## 3.582 -0.768 -5.208 -1.608 4.002
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 15.218 16.966 0.897 0.436
## x 0.430 1.404 0.306 0.779
##
## Residual standard error: 4.44 on 3 degrees of freedom
## Multiple R-squared: 0.03031, Adjusted R-squared: -0.2929
## F-statistic: 0.09379 on 1 and 3 DF, p-value: 0.7794
#Arrojara una tabla de covarianzas, en la que los valores seran a y b sustituidos en la formula de recta
abline(lm(y~x))
7
Grafica de dispersion de ejemplo
24
22
20
y
18
16
10 11 12 13 14
x
#La recta de regresion graficada
CAPITULO 6 La distribucion normal de probabilidad
6.1 DISTRIBUCIONES DE PROBABILIDAD PARA VARIABLES ALEATO-
RIAS CONTINUAS
Recuerde que, para variables aleatorias discretas, 1) la suma de todas las probabilidades p(x) es igual a 1, y
2) la probabilidad de que x quede en un intervalo determinado es la suma de todas las probabilidades en ese
intervalo.
• El área bajo una distribución continua de probabilidad es igual a 1. • La probabilidad de que x caiga en
un intervalo particular, por ejemplo de a a b, es igual al área bajo la curva entre los dos puntos a y b.
6.3 ÁREAS TABULADAS DE LA DISTRIBUCIÓN NORMAL DE PROBA-
BILIDAD
La variable aleatoria normal estandar
x−µ
z= σ o bien lo que es equivalente x = µ + zσ
datos <- c(10, 11, 12, 13, 14) #Datos ejemplo
x <- c(10 )#Valor dado en el problema
media <- mean(datos) #media de los datos
desv <- sd(datos) #Desviacion estandar de los datos dados
z<- (x-media)/(desv)
Este valor z que obtenemos es la distancia de nuestro estadistico de la media, medida en desviaciones estandar,
este lo buscamos en la tabla 3, para ver en que punto de la curva normal se encuentra
RESUMEN
8
1. La variable aleatoria normal estándar z tiene media 0 y desviación estándar 1.
2. Cualquier variable aleatoria normal x puede ser transformada a una variable aleatoria normal estándar
usando
$z=\frac{x-\mu}{\sigma}$
3. Convierta valores necesarios de x a z.
4. Use la tabla 3 del apéndice I para calcular probabilidades normales estándar.
CAPITULO 7 Distribuciones muestrales
La forma de la distribucion normal esta determinada por su media m y su desviacion estandar s, mientras que
la forma de la distribucion binomial esta determinada por p. Estas medidas numericas descriptivas, llamadas
parametros, son necesarias para calcular la probabilidad de observar resultados muestrales.
Es una muestra aleatoria simple si una muestra de n elementos se selecciona de entre una poblacion de n
elementos, usando un plan muestral en el que cada una de las posibles muestras tiene la misma probabilidad
de seleccion.
Un muestreo aleatorio estratificado comprende seleccionar una muestra aleatoria simple de cada uno de
un numero dado de subpoblaciones o estratos
Una muestra de conglomerados es una muestra aleatoria simple tomada de los conglomerados disponibles
en la poblacion.
Una muestra aleatoria sistematica 1 en k involucra la seleccion aleatoria de uno de los primeros k
elementos de una población ordenada y luego la selección sistematica de cada k-esimo elemento de ahi en
adelante.
La distribución muestral de una estadistica es la distribución de probabilidad para los posibles valores de
la estadistica, que resulta cuando muestras aleatorias de tamaño n se sacan repetidamente de la poblacion.
Hay tres formas de hallar la distribución muestral de una estadística: 1. Deducir la distribución matemática-
mente usando las leyes de probabilidad. 2. Usar una simulación para aproximar la distribución. Esto es,
sacar un gran número de muestras de tamaño n, calculando el valor de la estadística para cada muestra y
tabular los resultados en un histograma de frecuencia relativa. Cuando el número de muestras es grande, el
histograma será muy cercano a la distribución muestral teórica. 3. Usar teoremas estadísticos para obtener
distribuciones muestrales exactas o aproximadas.
El teorema del limite central
El teorema del límite central establece que, en condiciones más bien generales, las sumas y medias de muestras
aleatorias de mediciones tomadas de una población tienden a tener una distribución aproximadamente normal.
Cuando el tamaño muestral es lo suficientemente grande, se puede esperar que estos estimadores tengan
distribuciones muestrales que sean aproximadamente normales. Entonces se puede usar la distribución normal
para describir el comportamiento de estos estimadores en muestreo repetido y evaluar la probabilidad de
observar ciertos resultados muestrales. Al igual que en el capítulo 6, estas probabilidades se calculan usando
la variable aleatoria normal estándar
Estimador−M edia
z= Desviaciónestándar
La distribucion muestral de la proporcion muestral
Una aplicación común se relaciona con la preferencia del consumidor o encuestas de opinión, donde usamos
una muestra aleatoria de n personas, para estimar la proporción p de personas en la población que tienen una
característica especificada. Si x de las personas muestreadas tienen esta característica, entonces la proporción
muestral
9
x
p= nse puede usar para estimar la proporción poblacional p
tendra tambien una desviacion estandar SE(p̂) = pq
p
n donde q = 1 − p
CAPITULO 8 Estimacion de muestras grandes
TIPOS DE ESTIMADORES
Un estimador es una regla, generalmente expresada como fórmula, que nos dice cómo calcular una estimación
basada en información de la muestra.
Los estimadores se usan en dos formas diferentes:
• Estimación puntual: Con base en datos muestrales, se calcula un solo número para estimar el parámetro
poblacional. La regla o fórmula que describe este cálculo se denomina estimador puntual y el número
resultante recibe el nombre de estimación puntual.
• Estimación de intervalo: Con base en datos muestrales, dos números se calculan para formar un
intervalo dentro del cual se espera esté el parámetro. La regla o fórmula que describe este cálculo se denomina
estimador de intervalo y el par de números resultantes se llama estimación de intervalo o intervalo
de confianza.
ESTIMACION PUNTUAL
Se dice que un estimador de un parámetro es insesgado si la media de su distribución es igual al valor
verdadero del parámetro. De otro modo, se dice que el estimado está sesgado.
La distancia entre una estimación y el parámetro estimado recibe el nombre de error de estimación.
Distribución muestral de la media muestral
1. Cuando muestras de tamaño n se sacan al azar de una población normal con media µ y varianza σ 2 , la
media muestral x tiene una distribución normal con media σ y desviación estándar √σn
2. Cuando muestras de tamaño n se sacan al azar de una población no normal con media µ y varianza σ 2 ,
el teorema del límite central asegura que la media
√ muestral x tendrá una distribución aproximadamente
normal con media µ y desviación estándar σ/ ncuando n es grande
3. Las probabilidades que contengan la media muestral pueden calcularse al estandarizar el valor de x
usando z:
x+µ
z= √
σ/ n
10