UNIVERSIDAD NACIONAL HERMILIO VALDIZA´ N
FACULTAD DE E CONOM´IA
INFORME DE ESTAD´ISTICA
Visualizaci´on e interpretaci´on de gr´aficos en R Studio
Asignatura: Estad´ıstica Inferencial
Docente: MSc. Jeel CUEVA
Estudiante:
-Terrazos Pen˜ a, Jheremi
-Chavez Ventura, Niels Ludwing
-Maiz Villaran, Edith
-Tucto Espinoza, Jean
-Sanchez Acosta, Daniel
HU A´ NUCO - P E R U´
Junio 2025
´Indice
1. Introduccio´n 2
2. Visualizacio´n e Interpretacio´n de Gr´aficos 3
2.1. Histograma....................................................................................................................3
2.2. Boxplot de muestra normal........................................................................................4
2.3. Diagrama de dispersio´n...........................................................................................5
2.4. Gra´fico de barras de la distribucio´n binomial.......................................................6
3. Estad´ıstica Descriptiva B´asica 7
3.1. Histograma con curva de densidad............................................................................7
3.2. Boxplot.........................................................................................................................8
3.3. QQ-Plot........................................................................................................................9
3.4. Gra´fico de densidad................................................................................................10
3.5. Datos en R utilizados para los gra´ficos................................................................11
4. Introduccio´n a la inferencia estad´ıstica 12
4.1. Histograma de la poblacio´n...................................................................................12
4.2. Histograma de las medias muestrales......................................................................13
4.3. Datos en R utilizados para los gra´ficos de Inferencia Estad´ıstica......................14
5. An´alisis exploratorio y preparaci´on para inferencia 15
5.1. Histograma de Calificaciones....................................................................................15
5.2. Boxplot de Calificaciones por Grupo.......................................................................16
5.3. Gra´fico de dispersio´n: Horas de estudio vs Calificacio´n..................................17
5.4. Gra´fico de dispersio´n: Asistencia vs Calificaci´on.............................................18
5.5. Datos en R utilizados para los gra´ficos de Ana´lisis exploratorio.....................19
6. SECCIO´ N 1: ESTAD´ISTICA DESCRIPTIVA 20
6.1. Histograma con Curva de Densidad y L´ıneas de Tendencia Central...................20
6.2. Diagrama de Caja (Boxplot) MEDIA......................................................................21
6.3. Gra´fico Q-Q para Evaluar Normalidad.................................................................22
6.4. Curva de Densidad con Media y Mediana.............................................................23
6.5. Datos en R utilizados para los gr´aficos de SECCIO´ N 1: ESTAD´ISTICA
DESCRIPTIVA
....................................................................................................................................
24
7. Conclusio´n 25
8. ANEXOS 26
1
1. Introduccio´n
Este informe presenta los avances realizados en clase sobre gra´ficos estad´ısticos utili-
zando el lenguaje de programacio´n R dentro de RStudio. A partir de datos simulados, se
exploran diferentes tipos de distribuciones como la normal, uniforme y binomial, as´ı como
relaciones entre variables, medidas estad´ısticas ba´sicas e inferencia.
El objetivo principal es practicar la visualizaci´on y la interpretaci´on de datos,
conec- tando lo aprendido teo´ricamente con resultados gra´ficos y aplicados. Adema
´s, fue una buena oportunidad para seguir aprendiendo el uso de herramientas como
RStudio y La- TeX, que al inicio costaron un poco, pero poco a poco fueron siendo m a´ s
manejables.
M a´ s all´a de presentar los resultados, este informe refleja el proceso de aprendizaje y
esfuerzo por entender mejor co´mo se comportan los datos y co´mo representarlos de
forma clara. Aunque el trabajo fue exigente, tambi´en fue una forma de descubrir el valor
pra´ctico de lo que estamos estudiando.
2
2. Visualizacio´n e Interpretaci´on de Gr´aficos
2.1. Histograma
Figura 1: Histograma
C´odigo en R
# Distribuci´on normal
cat("Generacio´n de datos con distribuci´on normal:\n")
muestra_normal <- rnorm(1000, mean = 100, sd = 15)
cat("Primeros valores:", head(muestra_normal), "...\n")
cat("Media:", mean(muestra_normal), "\n") cat("Desviacio
´n esta´ndar:", sd(muestra_normal), "\n\n")
# Histograma
hist(muestra_normal, breaks = 20, col = "#FF83FA",
main = "Histograma de muestra normal",
xlab = "Valor", ylab = "Frecuencia")
Interpretacio´n
El histograma muestra la distribuci´on de una muestra de 1000 datos generados
alea- toriamente con media 100 y desviacio´n esta´ndar 15. A simple vista, se puede
ver que la mayor´ıa de los valores esta´n concentrados alrededor de 100, y que los
extremos tienen menos frecuencia. Esto es t´ıpico de una distribuci´on normal o .en
forma de campana”.
Los datos est´an distribuidos de manera bastante sim´etrica, lo que tambi´en es
una caracter´ıstica importante de la distribuci´on normal. La forma del gr´afico indica
que no hay muchos valores extremos ni sesgos, por lo que se puede decir que la
muestra sigue un patro´n normal esperado.
3
2.2. Boxplot de muestra normal
Figura 2: Boxplot
C´odigo en R
# Distribuci´on normal
cat("Generacio´n de datos con distribuci´on normal:\n")
muestra_normal <- rnorm(1000, mean = 100, sd = 15)
cat("Primeros valores:", head(muestra_normal), "...\n")
cat("Media:", mean(muestra_normal), "\n") cat("Desviacio
´n esta´ndar:", sd(muestra_normal), "\n\n")
# Diagrama de caja (boxplot)
boxplot(muestra_normal, main = "Boxplot de muestra normal",
col = "#EEEE00", ylab = "Valor")
Interpretacio´n
El boxplot muestra c´omo est´an distribuidos los datos de la muestra normal de
forma resumida. Se puede observar que el valor central (la mediana) esta´ cerca de 100,
que es lo esperado ya que la media tambi´en es 100. El ¸ca jo´nrepresenta el 50 %
central de los datos (entre el primer y tercer cuartil).
Las l´ıneas que salen de la caja (bigotes) indican el rango donde se encuentran la mayor
´ıa de los datos, y si hay puntos fuera de esos l´ımites, se consideran valores at´ıpicos. En
este caso, como la muestra viene de una distribucio´n normal, los datos esta´n bastante
sim´etricos y sin muchos valores extremos.
Este gr´afico es u´ til para ver ra´pidamente si hay sesgo, valores at´ıpicos o si los
datos esta´n concentrados en algu´ n rango.
4
2.3. Diagrama de dispersi´on
Figura 3: Gra´fico de dispersio´n con l´ınea de regresio´n
C´odigo en R
# Distribuci´on uniforme
cat("Generacio´n de datos con distribuci´on uniforme:\n")
muestra_uniforme <- runif(1000, min = 0, max = 100)
cat("Primeros valores:", head(muestra_uniforme), "...\n")
cat("Media:", mean(muestra_uniforme), "\n") cat("Desviacio
´n esta´ndar:", sd(muestra_uniforme), "\n\n")
# Gra´fico de dispersio´n
x_scatter <- runif(100, 0, 10)
y_scatter <- 2 * x_scatter + rnorm(100, 0, 2)
plot(x_scatter, y_scatter, pch = 19, col = "blue",
main = "Gra´fico de dispersi´on",
xlab = "X", ylab = "Y")
abline(lm(y_scatter ~ x_scatter), col = "red", lwd = 2)
Interpretacio´n
En este gra´fico de dispersi´on se puede ver la relacio´n entre dos variables: x
(valores generados aleatoriamente entre 0 y 10) y y, que fue generada como una funcio
´n lineal de x m a´ s un poco de ruido aleatorio.
Los puntos azules muestran c´omo se distribuyen las observaciones, y la l´ınea roja
representa la **recta de regresio´n** ajustada a los datos. Se nota una tendencia lineal
positiva clara: a medida que x aumenta, tambi´en lo hace y, lo cual era esperado ya que
se gener´o con la fo´rmula y = 2x + ε, donde ε es un pequen˜o error aleatorio.
Este tipo de gra´fico es u´ til para analizar si hay relacio´n entre dos variables y si
podr´ıa ser de tipo lineal.
5
2.4. Gr´afico de barras de la distribuci´on binomial
Figura 4: Gra´fico de barras de una distribuci´on binomial
C´odigo en R
# Distribuci´on binomial
cat("Generacio´n de datos con distribuci´on binomial:\n")
muestra_binomial <- rbinom(1000, size = 10, prob = 0.5)
tabla_frecuencias <- table(muestra_binomial)
cat("Tabla de frecuencias:\n")
print(tabla_frecuencias) cat("\
n")
# Gra´fico de barras
barplot(tabla_frecuencias, col = rainbow(length(tabla_frecuencias)),
main = "Distribucio´n binomial",
xlab = "Valor", ylab = "Frecuencia")
Interpretacio´n
Este gra´fico de barras representa la distribuci´on de los resultados obtenidos al ge-
nerar 1000 observaciones a partir de una distribucio´n binomial con n = 10 ensayos y
probabilidad de ´exito p = 0,5.
En el eje x se muestran los posibles valores que puede tomar una variable binomial
(desde 0 hasta 10 ´exitos), y en el eje y, la frecuencia con la que aparece cada valor.
Como se esperaba en una binomial sim´etrica con p = 0,5, la mayor concentraci´on
de datos est´a cerca del valor medio (en este caso n· p = 5). Esto crea una forma
aproximada- mente de campana, aunque discreta. Esta representacio´n permite ver de
forma clara cua´n frecuente es cada nu´mero de ´exitos en la muestra simulada.
6
3. Estad´ıstica Descriptiva B´asica
3.1. Histograma con curva de densidad
Figura 5: Histograma con curva de densidad
C´odigo en R
# Histograma con curva de densidad
hist(datos_ejemplo, col = "lightblue", probability = TRUE,
main = "Histograma con curva de densidad",
xlab = "Valor", ylab = "Densidad")
lines(density(datos_ejemplo), col = "red", lwd = 2)
abline(v = media, col = "blue", lwd = 2, lty = 2)
abline(v = mediana, col = "green", lwd = 2, lty = 3)
legend("topright",
legend = c("Densidad", "Media", "Mediana"),
col = c("red", "blue", "green"),
lwd = 2,
lty = c(1, 2, 3))
Interpretacio´n
El gra´fico de densidad representa la distribuci´on de los valores contenidos en el
conjunto de datos datos ejemplo. A diferencia de un histograma, este gra´fico muestra
una curva suave que estima la funcio´n de densidad de probabilidad.
En este caso, la curva no es perfectamente sim´etrica, ya que el conjunto de datos
fue generado a partir de dos grupos con medias diferentes (uno centrado en 70 y otro en
100). Esto provoca una ligera asimetr´ıa hacia la derecha (asimetr´ıa positiva). El gr´afico
permite identificar fa´cilmente la concentracio´n de valores y posibles modos (picos), lo
que resulta u´ til para describir el comportamiento de los datos en t´erminos generales.
7
3.2. Boxplot
Figura 6: Boxplot del conjunto de datos
C´odigo en R
# Boxplot
boxplot(datos_ejemplo, col = "lightgreen",
main = "Boxplot",
ylab = "Valor")
text(1.3, cuartiles,
labels = c("Q1", "Q2", "Q3"),
col = "red")
Interpretacio´n
El boxplot o diagrama de caja permite observar la distribucio´n de los datos y
detectar posibles valores at´ıpicos (outliers). En el gra´fico, la caja representa el rango
intercuart´ılico (entre el primer y tercer cuartil), la l´ınea dentro de la caja es la mediana,
y las “bigotes” se extienden hasta los valores dentro de un rango aceptable.
En este caso, se observa una caja algo desplazada hacia la izquierda, indicando cierta
asimetr´ıa hacia la derecha. Tambi´en se pueden ver puntos fuera de los bigotes, que repre-
sentan valores at´ıpicos. Esto es consistente con la forma en que se generaron los datos, ya
que una parte proviene de una poblacio´n con media mayor (100), lo cual estira los valores
hacia ese lado.
8
3.3. QQ-Plot
Figura 7: QQ-Plot de los datos respecto a la distribucio´n normal
C´odigo en R
qqnorm(datos_ejemplo,
main = "QQ-Plot: Comparaci´on con la distribuci´on normal",
col = "blue")
qqline(datos_ejemplo,
col = "red",
lwd = 2)
Interpretacio´n
El QQ-plot es una herramienta visual que permite evaluar si los datos siguen una
distribucio´n normal. En este gra´fico, los puntos representan los cuantiles observados
frente a los cuantiles teo´ricos de una distribucio´n normal.
Si los puntos se alinean aproximadamente sobre la l´ınea roja (que representa la norma-
lidad perfecta), podemos decir que los datos se ajustan a una distribucio´n normal. En este
caso, se observa que la mayor´ıa de los puntos siguen la l´ınea, aunque hay cierta desviaci
´on en los extremos. Esto indica que el conjunto de datos tiene una forma “casi normal”
pero con posibles colas pesadas o asimetr´ıa ligera, probablemente debido a la mezcla de
dos poblaciones distintas en los datos originales.
9
3.4. Gr´afico de densidad
Figura 8: Gra´fico de densidad
C´odigo en R
# Gra´fico de densidad
plot(density(datos_ejemplo), main = "Funci´on de densidad",
xlab = "Valor", ylab = "Densidad", col = "blue", lwd = 2)
polygon(density(datos_ejemplo), col = rgb(0, 0, 1, 0.2), border = NA)
abline(v = media, col = "red", lwd = 2, lty = 2)
abline(v = mediana, col = "green", lwd = 2, lty = 3)
legend("topright",
legend = c("Densidad", "Media", "Mediana"),
col = c("blue", "red", "green"),
lwd = 2,
lty = c(1, 2, 3))
Interpretacio´n
El histograma muestra la distribuci´on de frecuencias de los valores del conjunto de
datos agrupados en intervalos. Al habilitar probability = TRUE, el eje vertical representa
densidad en lugar de frecuencia absoluta, lo cual permite superponer la curva de densidad
suavizada.
La curva azul representa la estimaci´on de la funci´on de densidad de probabilidad.
En este gra´fico se puede notar una ligera asimetr´ıa hacia la derecha, indicando que
hay m ´a s valores extremos en ese sentido. La forma bimodal (con dos picos suaves)
tambi´en refleja que el conjunto fue generado a partir de dos grupos con medias
diferentes, lo cual se alinea con lo observado previamente en el gra´fico de densidad y el
boxplot.
10
3.5. Datos en R utilizados para los gr´aficos
# Generamos un conjunto de datos de ejemplo
[Link](456)
datos_ejemplo <- c(rnorm(80, mean = 70, sd = 10), rnorm(20, mean = 100, sd = 15))
# Medidas de tendencia central
media <- mean(datos_ejemplo)
mediana <- median(datos_ejemplo)
# Moda (funcio´n personalizada)
moda <- function(x) {
ux <- unique(x)
ux[[Link](tabulate(match(x, ux)))]
}
valor_moda <- moda(round(datos_ejemplo))
# Redondeamos para tener valores discretos
# Medidas de dispersi´on
varianza <- var(datos_ejemplo)
desv_est <- sd(datos_ejemplo)
rango <- range(datos_ejemplo)
rango_valor <- diff(range(datos_ejemplo))
iqr <- IQR(datos_ejemplo) # Rango intercuartı´lico
cuartiles <- quantile(datos_ejemplo, probs = c(0.25, 0.5, 0.75))
# Resumen completo
resumen <- summary(datos_ejemplo)
11
4. Introduccio´n a la inferencia estad´ıstica
4.1. Histograma de la poblaci´on
Figura 9: Histograma de la poblacio´n
C´odigo en R
# Histograma de la poblacio´n
hist(poblacion, breaks = 50, col = "#F0E68C",
main = "Distribucio´n de la poblacio´n",
xlab = "Valor", ylab = "Frecuencia",
xlim = c(40, 160))
abline(v = mean(poblacion), col = "red", lwd = 2)
Interpretacio´n
El histograma muestra co´mo se distribuyen los datos de la poblaci´on simulada,
genera- da con una distribucio´n normal con media 100 y desviacio´n esta´ndar 15. Como
se observa, la forma del histograma es aproximadamente sim´etrica, y la l´ınea roja
vertical indica la media poblacional. Este gr´afico sirve como referencia para comparar
con la distribucio´n de las medias muestrales.
12
4.2. Histograma de las medias muestrales
Figura 10: Histograma de medias muestrales
C´odigo en R
hist(medias_muestrales, breaks = 30, col = "lightgreen",
main = "Distribucio´n muestral de la media",
xlab = "Media muestral", ylab = "Frecuencia",
xlim = c(90, 110))
abline(v = mean(medias_muestrales), col = "red", lwd = 2)
Interpretacio´n
Este histograma representa la distribuci´on de 1000 medias obtenidas a partir de mues-
tras aleatorias de taman˜o 30 extra´ıdas de la poblacio´n. La distribucio´n de estas medias
tiene una forma m ´a s concentrada y estrecha que la poblacio´n original, evidenciando el
efecto del taman˜o muestral sobre la variabilidad. La l´ınea roja representa la media de las
medias muestrales, que es muy cercana a la media poblacional, ilustrando el concepto del
**teorema del l´ımite central**.
13
4.3. Datos en R utilizados para los gr´aficos de Inferencia
Es- tad´ıstica
# Simulaci´on de distribucio´n muestral de la media
[Link](789)
poblacion <- rnorm(100000, mean = 100, sd = 15)
cat("Para´metros de la poblacio´n:\n")
cat("- Media poblacional (mu):", mean(poblacion), "\n")
cat("- Desviaci´on est´andar poblacional (sigma):", sd(poblacion), "\n\n")
tamano_muestra <- 30
num_muestras <- 1000
medias_muestrales <- numeric(num_muestras)
for (i in 1:num_muestras) {
muestra <- sample(poblacion, tamano_muestra, replace = TRUE)
medias_muestrales[i] <- mean(muestra)
}
cat("Estadı´sticas de la distribucio´n muestral de la media (n=30):\n")
cat("- Media de las medias muestrales:", mean(medias_muestrales), "\n")
cat("- Desviaci´on est´andar de las medias muestrales:", sd(medias_muestrales), "\
n") cat("- Error esta´ndar teo´rico (sigma/sqrt(n)):",
sd(poblacion)/sqrt(tamano_muestra), "\n\n")
14
5. An´alisis exploratorio y preparacio´n para inferencia
5.1. Histograma de Calificaciones
Figura 11: Distribuci´on de calificaciones de los estudiantes
C´odigo en R
# Histograma de calificaciones
hist(datos_estudiantes$Calificacion, breaks = 10, col = "lightblue",
main = "Distribucio´n de Calificaciones",
xlab = "Calificacio´n", ylab = "Frecuencia")
Interpretacio´n
El histograma muestra la distribucio´n de las calificaciones obtenidas por los estudian-
tes. Se observa que la mayor´ıa de los estudiantes se concentra en rangos de calificaci´on
entre 60 y 90. La distribuci´on no es perfectamente sim´etrica y presenta una ligera concen-
tracio´n hacia los valores altos, lo cual podr´ıa sugerir un rendimiento acad´emico general
bueno en este conjunto de datos.
15
5.2. Boxplot de Calificaciones por Grupo
Figura 12: Distribuci´on de calificaciones por grupo
C´odigo en R
# Boxplot de calificaciones por grupo
boxplot(Calificacion ~ Grupo, data = datos_estudiantes,
col = c("lightblue", "lightgreen", "lightpink"),
main = "Calificaciones por Grupo",
xlab = "Grupo", ylab = "Calificaci
´on")
Interpretacio´n
Este gra´fico compara la distribuci´on de calificaciones entre los grupos A, B y C. Se
aprecia que el Grupo A tiende a tener calificaciones m a´ s altas que los dema´s,
mientras que el Grupo C muestra una mediana m a´ s baja y mayor dispersi´on. Esto
concuerda con la forma en que se generaron los datos, donde el grupo A ten´ıa un
efecto positivo en la calificacio´n y el C un efecto negativo.
16
5.3. Gr´afico de dispersio´n: Horas de estudio vs Calificacio´n
Figura 13: Gra´fico de dispersio´n: Horas de estudio y Calificacio´n
C´odigo en R
# Gra´fico de dispersio´n: Horas de estudio vs Calificacio´n
plot(datos_estudiantes$Horas_Estudio, datos_estudiantes$Calificacion,
pch = 19, col = "blue",
main = "Relacio´n entre Horas de Estudio y Calificaci
´on", xlab = "Horas de Estudio", ylab = "Calificaci´on")
abline(lm(Calificacion ~ Horas_Estudio, data = datos_estudiantes),
col = "red", lwd = 2)
Interpretacio´n
El gr´afico muestra una relacio´n positiva entre las horas de estudio y las calificaciones.
La l´ınea de regresio´n indica que, en general, a mayor cantidad de horas de estudio, mayor
es la calificaci´on obtenida. Esto refleja el impacto positivo que el estudio tiene sobre el
rendimiento acad´emico, aunque con cierta variabilidad.
17
5.4. Gr´afico de dispersio´n: Asistencia vs Calificacio´n
Figura 14: Gra´fico de dispersio´n: Asistencia y Calificacio´n
C´odigo en R
# Gra´fico de dispersio´n: Asistencia vs Calificacio´n
plot(datos_estudiantes$Asistencia, datos_estudiantes$Calificacion,
pch = 19, col = "green",
main = "Relacio´n entre Asistencia y Calificaci
´on", xlab = "Asistencia (%)", ylab = "Calificacio
´n")
abline(lm(Calificacion ~ Asistencia, data = datos_estudiantes),
col = "red", lwd = 2)
Interpretacio´n
Se observa una tendencia positiva entre la asistencia a clases y la calificaci´on final.
Aunque la relaci´on no es tan fuerte como la de las horas de estudio, existe un patro´n
donde los estudiantes con mayor porcentaje de asistencia tienden a obtener mejores cali-
ficaciones. Esto sugiere que la participaci´on constante tambi´en es un factor relevante
en el rendimiento acad´emico.
18
5.5. Datos en R utilizados para los gr´aficos de An´alisis
explora- torio
# Creamos un conjunto de datos simulado sobre rendimiento acad´emico
[Link](123)
n_estudiantes <- 100
datos_estudiantes <-
[Link]( ID =
1:n_estudiantes,
Horas_Estudio = round(runif(n_estudiantes, 1, 10), 1),
Asistencia = round(runif(n_estudiantes, 60, 100)),
Grupo = sample(c("A", "B", "C"),
n_estudiantes, replace = TRUE),
Sexo = sample(c("M", "F"),
n_estudiantes, replace = TRUE, prob = c(0.45, 0.55))
)
# An~adir calificaci´on que depende de las variables
anteriores (con algo de ruido)
datos_estudiantes$Calificacion <- 40 +
3 * datos_estudiantes$Horas_Estudio +
0.3 * datos_estudiantes$Asistencia +
ifelse(datos_estudiantes$Grupo == "A", 5,
ifelse(datos_estudiantes$Grupo == "B", 0, -5)) +
rnorm(n_estudiantes, 0, 8)
# Asegurar que las calificaciones est´en entre 0 y 100
datos_estudiantes$Calificacion <-
pmin(pmax(round(datos_estudiantes$Calificacion), 0), 100)
cat("Datos simulados de estudiantes:\n")
print(head(datos_estudiantes))
cat("\n")
cat("Resumen de las variables:\n")
print(summary(datos_estudiantes[,
c("Horas_Estudio", "Asistencia", "Calificacion")]))
cat("\n")
cat("Distribucio´n por Grupo y Sexo:\n")
print(table(datos_estudiantes$Grupo, datos_estudiantes$Sexo))
cat("\n")
19
6. SECCIO´ N 1: ESTAD´ISTICA DESCRIPTIVA
6.1. Histograma con Curva de Densidad y L´ıneas de Tendencia
Central
Figura 15: Histograma con curva de densidad y l´ıneas de tendencia central
C´odigo en R
# Histograma
hist(datos, main = "Histograma", xlab = "Valores", col = "bisque",
breaks = 15, probability = TRUE)
# An~adimos la curva de densidad
lines(density(datos), col = "red", lwd = 2)
# An~adimos l´ıneas verticales para la media y mediana
abline(v = media, col = "blue", lwd = 2, lty = 2)
abline(v = mediana, col = "darkorange", lwd = 2, lty = 3)
legend("topright", legend = c("Densidad", "Media", "Mediana"),
col = c("red", "blue", "darkorange"), lwd = 2, lty = c(1, 2, 3))
Interpretacio´n
Este gra´fico muestra un histograma de los datos simulados, junto con la curva de
densidad en rojo que proporciona una estimacio´n suavizada de la distribucio´n. Las l
´ıneas verticales indican dos medidas de tendencia central: la media (l´ınea azul
discontinua) y la mediana (l´ınea verde punteada).
La media se encuentra ligeramente desplazada respecto a la mediana, lo que sugiere
una leve asimetr´ıa en los datos. La presencia de dos grupos con medias distintas (uno
alrededor de 100 y otro de 130) genera una forma algo bimodal. Este gr´afico es u´ til
para visualizar la forma de la distribucio´n, la dispersi´on y la posicio´n de las medidas
centrales.
20
6.2. Diagrama de Caja (Boxplot) MEDIA
Figura 16: Diagrama de caja con la media marcada
C´odigo en R
# Diagrama de caja (boxplot)
boxplot(datos, main = "Diagrama de caja", col = "mediumpurple1",
ylab = "Valores")
# An~adimos puntos para la media
points(1, media, col = "red", pch = 19, cex = 1.5)
legend("topright", legend = "Media", col = "red", pch = 19)
Interpretacio´n
El diagrama de caja permite visualizar la dispersi´on, simetr´ıa y posibles valores at
´ıpicos de los datos. Las l´ıneas horizontales representan el m´ınimo, el primer cuartil
(Q1), la mediana (Q2), el tercer cuartil (Q3) y el m´aximo.
En este gra´fico, se ha an˜adido un punto rojo para marcar la ”media”del conjunto de
datos. La posicio´n relativa de la media respecto a la mediana ayuda a detectar la asimetr´ıa:
si la media est a´ por encima de la mediana, indica una distribucio´n sesgada a la
derecha; si est ´a por debajo, un sesgo a la izquierda. En nuestro caso, ambas est´an
cercanas, lo que sugiere una distribucio´n moderadamente sim´etrica con posible
presencia de valores at´ıpicos superiores.
21
6.3. Gr´afico Q-Q para Evaluar Normalidad
Figura 17: Gra´fico Q-Q para evaluar normalidad
C´odigo en R
# Gra´fico Q-Q para evaluar normalidad
qqnorm(datos, main = "Gr´afico Q-Q Normal")
qqline(datos, col = "olivedrab", lwd = 2)
Interpretacio´n
El gr´afico Q-Q compara la distribucio´n de los datos con una distribucio´n normal
teo´rica. Si los puntos siguen aproximadamente una l´ınea recta, como ocurre aqu´ı, se
puede asumir que los datos siguen una distribucio´n cercana a la normal. Las ligeras
desviaciones al inicio y al final son comunes en datos reales y no necesariamente indican
una violacio´n severa de la normalidad.
22
6.4. Curva de Densidad con Media y Mediana
Figura 18: Funcio´n de densidad con l´ıneas: Media y Mediana
C´odigo en R
# Gra´fico de densidad
plot(density(datos), main = "Funci´on de densidad",
xlab = "Valores", ylab = "Densidad", lwd = 2)
# An~adimos l´ıneas verticales para la media y mediana
abline(v = media, col = "cyan3", lwd = 2, lty = 2)
abline(v = mediana, col = "hotpink", lwd = 2, lty = 3)
legend("topright", legend = c("Densidad", "Media", "Mediana"),
col = c("black", "cyan3", "hotpink"), lwd = 2, lty = c(1, 2, 3))
Interpretacio´n
Este gr´afico muestra la distribucio´n suavizada de los datos. Se agregan l´ıneas
verticales para la media y la mediana, lo que permite evaluar visualmente la simetr´ıa. En
este caso, la media y la mediana esta´n relativamente cercanas, lo que respalda la
suposicio´n de una distribucio´n aproximadamente sim´etrica. La curva de densidad
proporciona una visio´n m a´ s suave y detallada que el histograma.
23
6.5. Datos en R utilizados para los gr´aficos de SECCIO´ N 1:
ESTAD´ISTICA DESCRIPTIVA
# Creamos un conjunto de datos simulado sobre rendimiento acad´emico
[Link](123)
n_estudiantes <- 100
datos_estudiantes <-
[Link]( ID =
1:n_estudiantes,
Horas_Estudio = round(runif(n_estudiantes, 1, 10), 1),
Asistencia = round(runif(n_estudiantes, 60, 100)),
Grupo = sample(c("A", "B", "C"), n_estudiantes, replace = TRUE),
Sexo = sample(c("M", "F"), n_estudiantes, replace = TRUE, prob = c(0.45, 0.55))
)
# An~adir calificaci´on que depende de las variables anteriores (con algo de ruido)
datos_estudiantes$Calificacion <- 40 +
3 * datos_estudiantes$Horas_Estudio +
0.3 * datos_estudiantes$Asistencia +
ifelse(datos_estudiantes$Grupo == "A", 5,
ifelse(datos_estudiantes$Grupo == "B", 0, -5)) +
rnorm(n_estudiantes, 0, 8)
# Asegurar que las calificaciones est´en entre 0 y 100
datos_estudiantes$Calificacion <- pmin(pmax(round(datos_estudiantes$Calificacion), 0)
cat("Datos simulados de estudiantes:\n")
print(head(datos_estudiantes))
cat("\n")
cat("Resumen de las variables:\n")
print(summary(datos_estudiantes[, c("Horas_Estudio", "Asistencia", "Calificacion")]))
cat("\n")
cat("Distribucio´n por Grupo y Sexo:\n")
print(table(datos_estudiantes$Grupo, datos_estudiantes$Sexo))
cat("\n")
24
7. Conclusio´n
A lo largo de este trabajo se desarrollaron distintas secciones que combinaron concep-
tos teo´ricos con la pr´actica en RStudio. Se crearon gra´ficos como histogramas, boxplots,
gra´ficos de dispersi´on, curvas de densidad y representaciones asociadas a la distribuci´on
normal, todos con sus respectivos co´digos y ana´lisis.
Aunque al inicio fue desafiante organizar todo correctamente (sobre todo entre R y
LaTeX), el proceso permitio´ afianzar lo aprendido en clase y mejorar la forma de comu-
nicar los resultados. Se not´o c´omo cambia la interpretacio´n de los datos cuando se
ven representados gra´ficamente.
Adema´s de reforzar conocimientos sobre estad´ıstica descriptiva e inferencia b
´asica, este trabajo tambi´en ayudo´ a ganar m ´a s confianza usando herramientas que
al principio parec´ıan complejas.
En resumen, este informe no solo sirvio´ para cumplir con una entrega acad´emica, sino
tambi´en como parte de un proceso en el que aprend´ı bastante, comet´ı errores y mejor´e,
con la esperanza de seguir progresando y no decepcionar a quienes nos ensen˜an con
exigencia y dedicaci´on.
25
8. ANEXOS
Figura 19: Primeros Gra´ficos
Figura 20: Anexo 02
26
Figura 21: Anexo 03
Figura 22: Estadistica Descriptiva
27
Figura 23: Anexo 05
Figura 24: Anexo 06
28
Figura 25: Anexo 07
Figura 26: Inferencia Estad´ıstica
29
Figura 27: Anexo 09
Figura 28: Anexo 10
30