0% encontró este documento útil (0 votos)
4 vistas10 páginas

Gráficas y Medidas en Estadística Descriptiva

Cargado por

Pokemon Go
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
4 vistas10 páginas

Gráficas y Medidas en Estadística Descriptiva

Cargado por

Pokemon Go
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

ManualEst

Villar Carranza Diana Cecilia

2023-01-18

CAPITULO 1 Descripción de datos por medio de gráficas


1.1 VARIABLES Y DATOS
Una variable es una característica que cambia o varía con el tiempo o para diferentes personas u objetos en
estudio.
Una unidad experimental es el individuo u objeto en el que se mide una variable. Resulta una sola
medición o datos cuando una variable se mide en realidad en una unidad experimental.
Una población es el conjunto de mediciones de interés para el investigador.
Una muestra es un subconjunto de mediciones seleccionado de la población de interés.

1.2 TIPOS DE VARIABLES


Las variables cualitativas miden una cualidad o característica en cada unidad experimental. Las variables
cuantitativas miden una cantidad numérica en cada unidad experimental.
Una variable discreta toma sólo un número finito o contable de valores. Una variable continua puede
tomar infinitamente muchos valores correspondientes a los puntos en un intervalo de recta.

1.3 GRÁFICAS PARA DATOS CATEGÓRICOS y 1.4 GRÁFICAS PARA


DATOS CUANTITATIVOS
Cuando la variable de interés es cualitativa o categórica, la tabla estadística es una lista de las categorías
incluidas junto con una medida de la frecuencia con que se presenta cada valor. Es posible medir “la frecuencia”
en tres formas diferentes:
• La frecuencia o número de mediciones en cada categoría
• La frecuencia relativa o proporción de mediciones en cada categoría
• El porcentaje de mediciones en cada categoría
F recuencia
F recuenciarelativa = n

P orcentaje = 100 ∗ F recuenciarelativa

Grafica de pastel

frecuencias<- c(35,260,93,12) #frecuencias ejemplo


etiquetas <- paste0(round(100 * frecuencias/sum(frecuencias), 2), "%")
#Se hace el calculo para que las etiquetas muestren el porcentaje de frecuencias

pie(frecuencias, labels = etiquetas, main="Grafica de pastel ejemplo")

1
Grafica de pastel ejemplo

65%
8.75%

3%

23.25%
#la funcion pie desplega una grafica de pastel

Grafica de barras

frecuencias<- c(35,260,93,12) #frecuencias ejemplo


# Gráfico de barras de frecuencia absoluta
mi_tabla <- table(frecuencias)
barplot(mi_tabla, main = "Frequencia absoluta",col = rainbow(3))

Frequencia absoluta
1.0
0.8
0.6
0.4
0.2
0.0

12 35 93 260
# Gráfico de barras de frecuencia relativa
barplot([Link](mi_tabla) * 100, main = "Frequencia relativa (%)",col = rainbow(3))

2
25
20
15
10
5
0 Frequencia relativa (%)

12 35 93 260

Grafico de lineas

plot(frecuencias, type = "l", main= "Grafico de lineas", col="blue" )

Grafico de lineas
250
200
frecuencias

150
100
50

1.0 1.5 2.0 2.5 3.0 3.5 4.0

Index

3
#Se convierte en grafico de lineas modificando el type

Grafico de tallo y hojas

datos <- c(90,70,70,70,75,70,65,68,60,74,70,95,75,70,68,65,40,65,70)


#Base de datos de ejemplo
stem(datos, scale=2)

##
## The decimal point is 1 digit(s) to the right of the |
##
## 4 | 0
## 5 |
## 6 | 055588
## 7 | 0000000455
## 8 |
## 9 | 05
#stem es la funcion para grafica de tallo y hojas

Histograma de frecuencia

hist(datos, main= "Histograma de frecuencia")

Histograma de frecuencia
12
10
8
Frequency

6
4
2
0

40 50 60 70 80 90 100

datos
#La funcion para histograma es hist

4
CAPITULO 2 Descripción de datos con medidas numéricas
DESCRIPCIÓN DE UN CONJUNTO DE DATOS CON MEDIDAS NUMÉRI-
CAS
Las mediciones descriptivas numéricas asociadas con una población de mediciones se llaman parámetros;
las calculadas a partir de mediciones muestrales reciben el nombre de estadísticas.

MEDIDAS DE CENTRO
La media aritmética o promedio de un conjunto de n mediciones es igual a la suma de las mediciones
dividida entre n.
P
xi
M ediamuestral : x = n
La mediana m de un conjunto de n mediciones es el valor de x que cae en la posición media cuando las
mediciones son ordenadas de menor a mayor.
La moda es la categoría o el valor de x que se presenta con más frecuencia.
datos <- c(8, 5, 6, 7, 9, 6, 9, 8, 7, 10, 7, 5, 9, 8, 6)
mean(datos)

## [1] 7.333333
datos <- c(8, 5, 6, 7, 9, 6, 9, 8, 7, 10, 7, 5, 9, 8, 6)
median(datos)

## [1] 7
datos <- c(8, 5, 6, 7, 9, 6, 9, 8, 7, 10, 7, 5, 9, 8, 6)
mode(datos)

## [1] "numeric"

Medidas de variabilidad
Rango, es la diferencia entre la medicion mas grande y la mas pequeña de un conjunto de n mediciones
Varianza es la suma de las desviaciones cuadradas de las mediciones alrededor de la media dividida entre
(n-1)
Desviacion estandar es el valor x menos la media
datoss <- c(5,7,1,2,4)
range(datoss)#rango de los datos

## [1] 1 7
var(datoss)#Varianza de los datos

## [1] 5.7
sd(datoss)#Desviacion estandar de los datos

## [1] 2.387467

Teorema de Chebyshev
Dado un número k mayor que o igual a 1 y un conjunto de n mediciones, al menos [1 (1/kˆ2)] de las mediciones
estarán dentro de k desviaciones estándar de su media.

5
• Al menos ninguna de las mediciones está en el intervalo µ − σ a µ + σ. contiene aprox, 68% de las mediciones
• Al menos 3/4 de las mediciones están en el intervalo 2µ − 2σ a 2µ + 2σ. contiene aprox, 95% de las
mediciones
• Al menos 8/9 de las mediciones están en el intervalo 3µ − 3σ a 3µ + 3σ. contiene aprox, 99.7% de las
mediciones

MEDICIONES DE POSICIÓN RELATIVA


El puntaje z muestral es una medida de posición relativa definida por
x−x
puntajez = s

Un puntaje z mide la distancia entre una observación y la media, medidas en unidades de


desviación estándar.

Grafica de caja
Los elementos que componen la grafica de caja es la mediana, los cuartiles superior e inferior y el IQR para el
conjunto de datos
datosss<-c(340, 300, 520, 340, 320, 290, 260, 330)
boxplot(datosss, horizontal = TRUE, main= "grafica de caja")

grafica de caja

250 300 350 400 450 500

CAPITULO 3 Descripcion de datos bivariados


Graficas de dispersion para dos variables cuantitativas
x<- c(10, 11, 12, 13, 14)
y<- c(23.1, 19.18, 15.17, 19.20, 25.24)
plot(x,y, main= "Grafica de dispersion de ejemplo")

6
Grafica de dispersion de ejemplo
24
22
20
y

18
16

10 11 12 13 14

Recta de regresion
s
las rectas corresponden a una formula general y = a + bx donde b = r( sxy ) y a = y − bx
x<- c(10, 11, 12, 13, 14)
y<- c(23.1, 19.18, 15.17, 19.20, 25.24)
plot(x,y, main= "Grafica de dispersion de ejemplo")
abline(lm(y~x))
#La recta de regresion graficada
summary(lm(y~x))

##
## Call:
## lm(formula = y ~ x)
##
## Residuals:
## 1 2 3 4 5
## 3.582 -0.768 -5.208 -1.608 4.002
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 15.218 16.966 0.897 0.436
## x 0.430 1.404 0.306 0.779
##
## Residual standard error: 4.44 on 3 degrees of freedom
## Multiple R-squared: 0.03031, Adjusted R-squared: -0.2929
## F-statistic: 0.09379 on 1 and 3 DF, p-value: 0.7794
#Arrojara una tabla de covarianzas, en la que los valores seran a y b sustituidos en la formula de recta
abline(lm(y~x))

7
Grafica de dispersion de ejemplo
24
22
20
y

18
16

10 11 12 13 14

x
#La recta de regresion graficada

CAPITULO 6 La distribucion normal de probabilidad


6.1 DISTRIBUCIONES DE PROBABILIDAD PARA VARIABLES ALEATO-
RIAS CONTINUAS
Recuerde que, para variables aleatorias discretas, 1) la suma de todas las probabilidades p(x) es igual a 1, y
2) la probabilidad de que x quede en un intervalo determinado es la suma de todas las probabilidades en ese
intervalo.
• El área bajo una distribución continua de probabilidad es igual a 1. • La probabilidad de que x caiga en
un intervalo particular, por ejemplo de a a b, es igual al área bajo la curva entre los dos puntos a y b.

6.3 ÁREAS TABULADAS DE LA DISTRIBUCIÓN NORMAL DE PROBA-


BILIDAD
La variable aleatoria normal estandar
x−µ
z= σ o bien lo que es equivalente x = µ + zσ
datos <- c(10, 11, 12, 13, 14) #Datos ejemplo
x <- c(10 )#Valor dado en el problema
media <- mean(datos) #media de los datos
desv <- sd(datos) #Desviacion estandar de los datos dados
z<- (x-media)/(desv)

Este valor z que obtenemos es la distancia de nuestro estadistico de la media, medida en desviaciones estandar,
este lo buscamos en la tabla 3, para ver en que punto de la curva normal se encuentra

RESUMEN

8
1. La variable aleatoria normal estándar z tiene media 0 y desviación estándar 1.
2. Cualquier variable aleatoria normal x puede ser transformada a una variable aleatoria normal estándar
usando
$z=\frac{x-\mu}{\sigma}$
3. Convierta valores necesarios de x a z.
4. Use la tabla 3 del apéndice I para calcular probabilidades normales estándar.

CAPITULO 7 Distribuciones muestrales


La forma de la distribucion normal esta determinada por su media m y su desviacion estandar s, mientras que
la forma de la distribucion binomial esta determinada por p. Estas medidas numericas descriptivas, llamadas
parametros, son necesarias para calcular la probabilidad de observar resultados muestrales.
Es una muestra aleatoria simple si una muestra de n elementos se selecciona de entre una poblacion de n
elementos, usando un plan muestral en el que cada una de las posibles muestras tiene la misma probabilidad
de seleccion.
Un muestreo aleatorio estratificado comprende seleccionar una muestra aleatoria simple de cada uno de
un numero dado de subpoblaciones o estratos
Una muestra de conglomerados es una muestra aleatoria simple tomada de los conglomerados disponibles
en la poblacion.
Una muestra aleatoria sistematica 1 en k involucra la seleccion aleatoria de uno de los primeros k
elementos de una población ordenada y luego la selección sistematica de cada k-esimo elemento de ahi en
adelante.
La distribución muestral de una estadistica es la distribución de probabilidad para los posibles valores de
la estadistica, que resulta cuando muestras aleatorias de tamaño n se sacan repetidamente de la poblacion.
Hay tres formas de hallar la distribución muestral de una estadística: 1. Deducir la distribución matemática-
mente usando las leyes de probabilidad. 2. Usar una simulación para aproximar la distribución. Esto es,
sacar un gran número de muestras de tamaño n, calculando el valor de la estadística para cada muestra y
tabular los resultados en un histograma de frecuencia relativa. Cuando el número de muestras es grande, el
histograma será muy cercano a la distribución muestral teórica. 3. Usar teoremas estadísticos para obtener
distribuciones muestrales exactas o aproximadas.

El teorema del limite central


El teorema del límite central establece que, en condiciones más bien generales, las sumas y medias de muestras
aleatorias de mediciones tomadas de una población tienden a tener una distribución aproximadamente normal.
Cuando el tamaño muestral es lo suficientemente grande, se puede esperar que estos estimadores tengan
distribuciones muestrales que sean aproximadamente normales. Entonces se puede usar la distribución normal
para describir el comportamiento de estos estimadores en muestreo repetido y evaluar la probabilidad de
observar ciertos resultados muestrales. Al igual que en el capítulo 6, estas probabilidades se calculan usando
la variable aleatoria normal estándar
Estimador−M edia
z= Desviaciónestándar

La distribucion muestral de la proporcion muestral


Una aplicación común se relaciona con la preferencia del consumidor o encuestas de opinión, donde usamos
una muestra aleatoria de n personas, para estimar la proporción p de personas en la población que tienen una
característica especificada. Si x de las personas muestreadas tienen esta característica, entonces la proporción
muestral

9
x
p= nse puede usar para estimar la proporción poblacional p
tendra tambien una desviacion estandar SE(p̂) = pq
p
n donde q = 1 − p

CAPITULO 8 Estimacion de muestras grandes


TIPOS DE ESTIMADORES
Un estimador es una regla, generalmente expresada como fórmula, que nos dice cómo calcular una estimación
basada en información de la muestra.
Los estimadores se usan en dos formas diferentes:
• Estimación puntual: Con base en datos muestrales, se calcula un solo número para estimar el parámetro
poblacional. La regla o fórmula que describe este cálculo se denomina estimador puntual y el número
resultante recibe el nombre de estimación puntual.
• Estimación de intervalo: Con base en datos muestrales, dos números se calculan para formar un
intervalo dentro del cual se espera esté el parámetro. La regla o fórmula que describe este cálculo se denomina
estimador de intervalo y el par de números resultantes se llama estimación de intervalo o intervalo
de confianza.

ESTIMACION PUNTUAL
Se dice que un estimador de un parámetro es insesgado si la media de su distribución es igual al valor
verdadero del parámetro. De otro modo, se dice que el estimado está sesgado.
La distancia entre una estimación y el parámetro estimado recibe el nombre de error de estimación.

Distribución muestral de la media muestral


1. Cuando muestras de tamaño n se sacan al azar de una población normal con media µ y varianza σ 2 , la
media muestral x tiene una distribución normal con media σ y desviación estándar √σn

2. Cuando muestras de tamaño n se sacan al azar de una población no normal con media µ y varianza σ 2 ,
el teorema del límite central asegura que la media
√ muestral x tendrá una distribución aproximadamente
normal con media µ y desviación estándar σ/ ncuando n es grande
3. Las probabilidades que contengan la media muestral pueden calcularse al estandarizar el valor de x
usando z:
x+µ
z= √
σ/ n

10

También podría gustarte