0% encontró este documento útil (0 votos)
3 vistas31 páginas

Gráficos Estadísticos en R Studio

El informe presenta el uso de R Studio para la visualización e interpretación de gráficos estadísticos, incluyendo histogramas, boxplots y diagramas de dispersión. Se exploran diferentes distribuciones y relaciones entre variables a partir de datos simulados, con un enfoque en la práctica de la estadística inferencial. Además, se documenta el proceso de aprendizaje y la aplicación de herramientas estadísticas en un contexto académico.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas31 páginas

Gráficos Estadísticos en R Studio

El informe presenta el uso de R Studio para la visualización e interpretación de gráficos estadísticos, incluyendo histogramas, boxplots y diagramas de dispersión. Se exploran diferentes distribuciones y relaciones entre variables a partir de datos simulados, con un enfoque en la práctica de la estadística inferencial. Además, se documenta el proceso de aprendizaje y la aplicación de herramientas estadísticas en un contexto académico.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Universidad Nacional Hermilio Valdizán

Facultad de Economı́a

INFORME DE ESTADÍSTICA
Visualización e interpretación de gráficos en R Studio

Asignatura: Estadı́stica Inferencial


Docente: MSc. Jeel CUEVA
Estudiante:
-Terrazos Peña, Jheremi
-Chavez Ventura, Niels Ludwing
-Maiz Villaran, Edith
-Tucto Espinoza, Jean
-Sanchez Acosta, Daniel

HUÁNUCO - PERÚ
Junio 2025
Índice
1. Introducción 2

2. Visualización e Interpretación de Gráficos 3


2.1. Histograma . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
2.2. Boxplot de muestra normal . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
2.3. Diagrama de dispersión . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
2.4. Gráfico de barras de la distribución binomial . . . . . . . . . . . . . . . . . 6

3. Estadı́stica Descriptiva Básica 7


3.1. Histograma con curva de densidad . . . . . . . . . . . . . . . . . . . . . . . 7
3.2. Boxplot . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8
3.3. QQ-Plot . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
3.4. Gráfico de densidad . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
3.5. Datos en R utilizados para los gráficos . . . . . . . . . . . . . . . . . . . . 11

4. Introducción a la inferencia estadı́stica 12


4.1. Histograma de la población . . . . . . . . . . . . . . . . . . . . . . . . . . 12
4.2. Histograma de las medias muestrales . . . . . . . . . . . . . . . . . . . . . 13
4.3. Datos en R utilizados para los gráficos de Inferencia Estadı́stica . . . . . . 14

5. Análisis exploratorio y preparación para inferencia 15


5.1. Histograma de Calificaciones . . . . . . . . . . . . . . . . . . . . . . . . . . 15
5.2. Boxplot de Calificaciones por Grupo . . . . . . . . . . . . . . . . . . . . . 16
5.3. Gráfico de dispersión: Horas de estudio vs Calificación . . . . . . . . . . . . 17
5.4. Gráfico de dispersión: Asistencia vs Calificación . . . . . . . . . . . . . . . 18
5.5. Datos en R utilizados para los gráficos de Análisis exploratorio . . . . . . . 19

6. SECCIÓN 1: ESTADÍSTICA DESCRIPTIVA 20


6.1. Histograma con Curva de Densidad y Lı́neas de Tendencia Central . . . . . 20
6.2. Diagrama de Caja (Boxplot) MEDIA . . . . . . . . . . . . . . . . . . . . . 21
6.3. Gráfico Q-Q para Evaluar Normalidad . . . . . . . . . . . . . . . . . . . . 22
6.4. Curva de Densidad con Media y Mediana . . . . . . . . . . . . . . . . . . . 23
6.5. Datos en R utilizados para los gráficos de SECCIÓN 1: ESTADÍSTICA
DESCRIPTIVA . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24

7. Conclusión 25

8. ANEXOS 26

1
1. Introducción
Este informe presenta los avances realizados en clase sobre gráficos estadı́sticos utili-
zando el lenguaje de programación R dentro de RStudio. A partir de datos simulados, se
exploran diferentes tipos de distribuciones como la normal, uniforme y binomial, ası́ como
relaciones entre variables, medidas estadı́sticas básicas e inferencia.
El objetivo principal es practicar la visualización y la interpretación de datos, conec-
tando lo aprendido teóricamente con resultados gráficos y aplicados. Además, fue una
buena oportunidad para seguir aprendiendo el uso de herramientas como RStudio y La-
TeX, que al inicio costaron un poco, pero poco a poco fueron siendo más manejables.
Más allá de presentar los resultados, este informe refleja el proceso de aprendizaje y
esfuerzo por entender mejor cómo se comportan los datos y cómo representarlos de forma
clara. Aunque el trabajo fue exigente, también fue una forma de descubrir el valor práctico
de lo que estamos estudiando.

2
2. Visualización e Interpretación de Gráficos
2.1. Histograma

Figura 1: Histograma

Código en R
# Distribución normal
cat("Generación de datos con distribución normal:\n")
muestra_normal <- rnorm(1000, mean = 100, sd = 15)
cat("Primeros valores:", head(muestra_normal), "...\n")
cat("Media:", mean(muestra_normal), "\n")
cat("Desviación estándar:", sd(muestra_normal), "\n\n")

# Histograma
hist(muestra_normal, breaks = 20, col = "#FF83FA",
main = "Histograma de muestra normal",
xlab = "Valor", ylab = "Frecuencia")

Interpretación
El histograma muestra la distribución de una muestra de 1000 datos generados alea-
toriamente con media 100 y desviación estándar 15. A simple vista, se puede ver que la
mayorı́a de los valores están concentrados alrededor de 100, y que los extremos tienen
menos frecuencia. Esto es tı́pico de una distribución normal o .en forma de campana”.
Los datos están distribuidos de manera bastante simétrica, lo que también es una
caracterı́stica importante de la distribución normal. La forma del gráfico indica que no
hay muchos valores extremos ni sesgos, por lo que se puede decir que la muestra sigue un
patrón normal esperado.

3
2.2. Boxplot de muestra normal

Figura 2: Boxplot

Código en R
# Distribución normal
cat("Generación de datos con distribución normal:\n")
muestra_normal <- rnorm(1000, mean = 100, sd = 15)
cat("Primeros valores:", head(muestra_normal), "...\n")
cat("Media:", mean(muestra_normal), "\n")
cat("Desviación estándar:", sd(muestra_normal), "\n\n")

# Diagrama de caja (boxplot)


boxplot(muestra_normal, main = "Boxplot de muestra normal",
col = "#EEEE00", ylab = "Valor")

Interpretación
El boxplot muestra cómo están distribuidos los datos de la muestra normal de forma
resumida. Se puede observar que el valor central (la mediana) está cerca de 100, que es lo
esperado ya que la media también es 100. El çajónrepresenta el 50 % central de los datos
(entre el primer y tercer cuartil).
Las lı́neas que salen de la caja (bigotes) indican el rango donde se encuentran la
mayorı́a de los datos, y si hay puntos fuera de esos lı́mites, se consideran valores atı́picos.
En este caso, como la muestra viene de una distribución normal, los datos están bastante
simétricos y sin muchos valores extremos.
Este gráfico es útil para ver rápidamente si hay sesgo, valores atı́picos o si los datos
están concentrados en algún rango.

4
2.3. Diagrama de dispersión

Figura 3: Gráfico de dispersión con lı́nea de regresión

Código en R
# Distribución uniforme
cat("Generación de datos con distribución uniforme:\n")
muestra_uniforme <- runif(1000, min = 0, max = 100)
cat("Primeros valores:", head(muestra_uniforme), "...\n")
cat("Media:", mean(muestra_uniforme), "\n")
cat("Desviación estándar:", sd(muestra_uniforme), "\n\n")

# Gráfico de dispersión
x_scatter <- runif(100, 0, 10)
y_scatter <- 2 * x_scatter + rnorm(100, 0, 2)
plot(x_scatter, y_scatter, pch = 19, col = "blue",
main = "Gráfico de dispersión",
xlab = "X", ylab = "Y")
abline(lm(y_scatter ~ x_scatter), col = "red", lwd = 2)

Interpretación
En este gráfico de dispersión se puede ver la relación entre dos variables: x (valores
generados aleatoriamente entre 0 y 10) y y, que fue generada como una función lineal de
x más un poco de ruido aleatorio.
Los puntos azules muestran cómo se distribuyen las observaciones, y la lı́nea roja
representa la **recta de regresión** ajustada a los datos. Se nota una tendencia lineal
positiva clara: a medida que x aumenta, también lo hace y, lo cual era esperado ya que
se generó con la fórmula y = 2x + ε, donde ε es un pequeño error aleatorio.
Este tipo de gráfico es útil para analizar si hay relación entre dos variables y si podrı́a
ser de tipo lineal.

5
2.4. Gráfico de barras de la distribución binomial

Figura 4: Gráfico de barras de una distribución binomial

Código en R
# Distribución binomial
cat("Generación de datos con distribución binomial:\n")
muestra_binomial <- rbinom(1000, size = 10, prob = 0.5)
tabla_frecuencias <- table(muestra_binomial)
cat("Tabla de frecuencias:\n")
print(tabla_frecuencias)
cat("\n")

# Gráfico de barras
barplot(tabla_frecuencias, col = rainbow(length(tabla_frecuencias)),
main = "Distribución binomial",
xlab = "Valor", ylab = "Frecuencia")

Interpretación
Este gráfico de barras representa la distribución de los resultados obtenidos al ge-
nerar 1000 observaciones a partir de una distribución binomial con n = 10 ensayos y
probabilidad de éxito p = 0,5.
En el eje x se muestran los posibles valores que puede tomar una variable binomial
(desde 0 hasta 10 éxitos), y en el eje y, la frecuencia con la que aparece cada valor.
Como se esperaba en una binomial simétrica con p = 0,5, la mayor concentración de
datos está cerca del valor medio (en este caso n · p = 5). Esto crea una forma aproximada-
mente de campana, aunque discreta. Esta representación permite ver de forma clara cuán
frecuente es cada número de éxitos en la muestra simulada.

6
3. Estadı́stica Descriptiva Básica
3.1. Histograma con curva de densidad

Figura 5: Histograma con curva de densidad

Código en R
# Histograma con curva de densidad
hist(datos_ejemplo, col = "lightblue", probability = TRUE,
main = "Histograma con curva de densidad",
xlab = "Valor", ylab = "Densidad")
lines(density(datos_ejemplo), col = "red", lwd = 2)
abline(v = media, col = "blue", lwd = 2, lty = 2)
abline(v = mediana, col = "green", lwd = 2, lty = 3)
legend("topright",
legend = c("Densidad", "Media", "Mediana"),
col = c("red", "blue", "green"),
lwd = 2,
lty = c(1, 2, 3))

Interpretación
El gráfico de densidad representa la distribución de los valores contenidos en el conjunto
de datos datos ejemplo. A diferencia de un histograma, este gráfico muestra una curva
suave que estima la función de densidad de probabilidad.
En este caso, la curva no es perfectamente simétrica, ya que el conjunto de datos fue
generado a partir de dos grupos con medias diferentes (uno centrado en 70 y otro en 100).
Esto provoca una ligera asimetrı́a hacia la derecha (asimetrı́a positiva). El gráfico permite
identificar fácilmente la concentración de valores y posibles modos (picos), lo que resulta
útil para describir el comportamiento de los datos en términos generales.

7
3.2. Boxplot

Figura 6: Boxplot del conjunto de datos

Código en R
# Boxplot
boxplot(datos_ejemplo, col = "lightgreen",
main = "Boxplot",
ylab = "Valor")
text(1.3, cuartiles,
labels = c("Q1", "Q2", "Q3"),
col = "red")

Interpretación
El boxplot o diagrama de caja permite observar la distribución de los datos y detectar
posibles valores atı́picos (outliers). En el gráfico, la caja representa el rango intercuartı́lico
(entre el primer y tercer cuartil), la lı́nea dentro de la caja es la mediana, y las “bigotes”
se extienden hasta los valores dentro de un rango aceptable.
En este caso, se observa una caja algo desplazada hacia la izquierda, indicando cierta
asimetrı́a hacia la derecha. También se pueden ver puntos fuera de los bigotes, que repre-
sentan valores atı́picos. Esto es consistente con la forma en que se generaron los datos, ya
que una parte proviene de una población con media mayor (100), lo cual estira los valores
hacia ese lado.

8
3.3. QQ-Plot

Figura 7: QQ-Plot de los datos respecto a la distribución normal

Código en R
qqnorm(datos_ejemplo,
main = "QQ-Plot: Comparación con la distribución normal",
col = "blue")
qqline(datos_ejemplo,
col = "red",
lwd = 2)

Interpretación
El QQ-plot es una herramienta visual que permite evaluar si los datos siguen una
distribución normal. En este gráfico, los puntos representan los cuantiles observados frente
a los cuantiles teóricos de una distribución normal.
Si los puntos se alinean aproximadamente sobre la lı́nea roja (que representa la norma-
lidad perfecta), podemos decir que los datos se ajustan a una distribución normal. En este
caso, se observa que la mayorı́a de los puntos siguen la lı́nea, aunque hay cierta desviación
en los extremos. Esto indica que el conjunto de datos tiene una forma “casi normal” pero
con posibles colas pesadas o asimetrı́a ligera, probablemente debido a la mezcla de dos
poblaciones distintas en los datos originales.

9
3.4. Gráfico de densidad

Figura 8: Gráfico de densidad

Código en R
# Gráfico de densidad
plot(density(datos_ejemplo), main = "Función de densidad",
xlab = "Valor", ylab = "Densidad", col = "blue", lwd = 2)
polygon(density(datos_ejemplo), col = rgb(0, 0, 1, 0.2), border = NA)
abline(v = media, col = "red", lwd = 2, lty = 2)
abline(v = mediana, col = "green", lwd = 2, lty = 3)
legend("topright",
legend = c("Densidad", "Media", "Mediana"),
col = c("blue", "red", "green"),
lwd = 2,
lty = c(1, 2, 3))

Interpretación
El histograma muestra la distribución de frecuencias de los valores del conjunto de
datos agrupados en intervalos. Al habilitar probability = TRUE, el eje vertical representa
densidad en lugar de frecuencia absoluta, lo cual permite superponer la curva de densidad
suavizada.
La curva azul representa la estimación de la función de densidad de probabilidad. En
este gráfico se puede notar una ligera asimetrı́a hacia la derecha, indicando que hay más
valores extremos en ese sentido. La forma bimodal (con dos picos suaves) también refleja
que el conjunto fue generado a partir de dos grupos con medias diferentes, lo cual se alinea
con lo observado previamente en el gráfico de densidad y el boxplot.

10
3.5. Datos en R utilizados para los gráficos
# Generamos un conjunto de datos de ejemplo
[Link](456)
datos_ejemplo <- c(rnorm(80, mean = 70, sd = 10), rnorm(20, mean = 100, sd = 15))

# Medidas de tendencia central


media <- mean(datos_ejemplo)
mediana <- median(datos_ejemplo)
# Moda (función personalizada)
moda <- function(x) {
ux <- unique(x)
ux[[Link](tabulate(match(x, ux)))]
}
valor_moda <- moda(round(datos_ejemplo))
# Redondeamos para tener valores discretos

# Medidas de dispersión
varianza <- var(datos_ejemplo)
desv_est <- sd(datos_ejemplo)
rango <- range(datos_ejemplo)
rango_valor <- diff(range(datos_ejemplo))
iqr <- IQR(datos_ejemplo) # Rango intercuartı́lico
cuartiles <- quantile(datos_ejemplo, probs = c(0.25, 0.5, 0.75))

# Resumen completo
resumen <- summary(datos_ejemplo)

11
4. Introducción a la inferencia estadı́stica
4.1. Histograma de la población

Figura 9: Histograma de la población

Código en R
# Histograma de la población
hist(poblacion, breaks = 50, col = "#F0E68C",
main = "Distribución de la población",
xlab = "Valor", ylab = "Frecuencia",
xlim = c(40, 160))
abline(v = mean(poblacion), col = "red", lwd = 2)

Interpretación
El histograma muestra cómo se distribuyen los datos de la población simulada, genera-
da con una distribución normal con media 100 y desviación estándar 15. Como se observa,
la forma del histograma es aproximadamente simétrica, y la lı́nea roja vertical indica la
media poblacional. Este gráfico sirve como referencia para comparar con la distribución
de las medias muestrales.

12
4.2. Histograma de las medias muestrales

Figura 10: Histograma de medias muestrales

Código en R
hist(medias_muestrales, breaks = 30, col = "lightgreen",
main = "Distribución muestral de la media",
xlab = "Media muestral", ylab = "Frecuencia",
xlim = c(90, 110))
abline(v = mean(medias_muestrales), col = "red", lwd = 2)

Interpretación
Este histograma representa la distribución de 1000 medias obtenidas a partir de mues-
tras aleatorias de tamaño 30 extraı́das de la población. La distribución de estas medias
tiene una forma más concentrada y estrecha que la población original, evidenciando el
efecto del tamaño muestral sobre la variabilidad. La lı́nea roja representa la media de las
medias muestrales, que es muy cercana a la media poblacional, ilustrando el concepto del
**teorema del lı́mite central**.

13
4.3. Datos en R utilizados para los gráficos de Inferencia Es-
tadı́stica
# Simulación de distribución muestral de la media
[Link](789)
poblacion <- rnorm(100000, mean = 100, sd = 15)
cat("Parámetros de la población:\n")
cat("- Media poblacional (mu):", mean(poblacion), "\n")
cat("- Desviación estándar poblacional (sigma):", sd(poblacion), "\n\n")

tamano_muestra <- 30
num_muestras <- 1000
medias_muestrales <- numeric(num_muestras)

for (i in 1:num_muestras) {
muestra <- sample(poblacion, tamano_muestra, replace = TRUE)
medias_muestrales[i] <- mean(muestra)
}

cat("Estadı́sticas de la distribución muestral de la media (n=30):\n")


cat("- Media de las medias muestrales:", mean(medias_muestrales), "\n")
cat("- Desviación estándar de las medias muestrales:", sd(medias_muestrales), "\n")
cat("- Error estándar teórico (sigma/sqrt(n)):",
sd(poblacion)/sqrt(tamano_muestra), "\n\n")

14
5. Análisis exploratorio y preparación para inferencia
5.1. Histograma de Calificaciones

Figura 11: Distribución de calificaciones de los estudiantes

Código en R
# Histograma de calificaciones
hist(datos_estudiantes$Calificacion, breaks = 10, col = "lightblue",
main = "Distribución de Calificaciones",
xlab = "Calificación", ylab = "Frecuencia")

Interpretación
El histograma muestra la distribución de las calificaciones obtenidas por los estudian-
tes. Se observa que la mayorı́a de los estudiantes se concentra en rangos de calificación
entre 60 y 90. La distribución no es perfectamente simétrica y presenta una ligera concen-
tración hacia los valores altos, lo cual podrı́a sugerir un rendimiento académico general
bueno en este conjunto de datos.

15
5.2. Boxplot de Calificaciones por Grupo

Figura 12: Distribución de calificaciones por grupo

Código en R
# Boxplot de calificaciones por grupo
boxplot(Calificacion ~ Grupo, data = datos_estudiantes,
col = c("lightblue", "lightgreen", "lightpink"),
main = "Calificaciones por Grupo",
xlab = "Grupo", ylab = "Calificación")

Interpretación
Este gráfico compara la distribución de calificaciones entre los grupos A, B y C. Se
aprecia que el Grupo A tiende a tener calificaciones más altas que los demás, mientras
que el Grupo C muestra una mediana más baja y mayor dispersión. Esto concuerda con
la forma en que se generaron los datos, donde el grupo A tenı́a un efecto positivo en la
calificación y el C un efecto negativo.

16
5.3. Gráfico de dispersión: Horas de estudio vs Calificación

Figura 13: Gráfico de dispersión: Horas de estudio y Calificación

Código en R
# Gráfico de dispersión: Horas de estudio vs Calificación
plot(datos_estudiantes$Horas_Estudio, datos_estudiantes$Calificacion,
pch = 19, col = "blue",
main = "Relación entre Horas de Estudio y Calificación",
xlab = "Horas de Estudio", ylab = "Calificación")
abline(lm(Calificacion ~ Horas_Estudio, data = datos_estudiantes),
col = "red", lwd = 2)

Interpretación
El gráfico muestra una relación positiva entre las horas de estudio y las calificaciones.
La lı́nea de regresión indica que, en general, a mayor cantidad de horas de estudio, mayor
es la calificación obtenida. Esto refleja el impacto positivo que el estudio tiene sobre el
rendimiento académico, aunque con cierta variabilidad.

17
5.4. Gráfico de dispersión: Asistencia vs Calificación

Figura 14: Gráfico de dispersión: Asistencia y Calificación

Código en R
# Gráfico de dispersión: Asistencia vs Calificación
plot(datos_estudiantes$Asistencia, datos_estudiantes$Calificacion,
pch = 19, col = "green",
main = "Relación entre Asistencia y Calificación",
xlab = "Asistencia (%)", ylab = "Calificación")
abline(lm(Calificacion ~ Asistencia, data = datos_estudiantes),
col = "red", lwd = 2)

Interpretación
Se observa una tendencia positiva entre la asistencia a clases y la calificación final.
Aunque la relación no es tan fuerte como la de las horas de estudio, existe un patrón
donde los estudiantes con mayor porcentaje de asistencia tienden a obtener mejores cali-
ficaciones. Esto sugiere que la participación constante también es un factor relevante en
el rendimiento académico.

18
5.5. Datos en R utilizados para los gráficos de Análisis explora-
torio
# Creamos un conjunto de datos simulado sobre rendimiento académico
[Link](123)
n_estudiantes <- 100

datos_estudiantes <- [Link](


ID = 1:n_estudiantes,
Horas_Estudio = round(runif(n_estudiantes, 1, 10), 1),
Asistencia = round(runif(n_estudiantes, 60, 100)),
Grupo = sample(c("A", "B", "C"),
n_estudiantes, replace = TRUE),
Sexo = sample(c("M", "F"),
n_estudiantes, replace = TRUE, prob = c(0.45, 0.55))
)

# A~
nadir calificación que depende de las variables anteriores
(con algo de ruido)
datos_estudiantes$Calificacion <- 40 +
3 * datos_estudiantes$Horas_Estudio +
0.3 * datos_estudiantes$Asistencia +
ifelse(datos_estudiantes$Grupo == "A", 5,
ifelse(datos_estudiantes$Grupo == "B", 0, -5)) +
rnorm(n_estudiantes, 0, 8)

# Asegurar que las calificaciones estén entre 0 y 100


datos_estudiantes$Calificacion <-
pmin(pmax(round(datos_estudiantes$Calificacion), 0), 100)

cat("Datos simulados de estudiantes:\n")


print(head(datos_estudiantes))
cat("\n")

cat("Resumen de las variables:\n")


print(summary(datos_estudiantes[,
c("Horas_Estudio", "Asistencia", "Calificacion")]))
cat("\n")

cat("Distribución por Grupo y Sexo:\n")


print(table(datos_estudiantes$Grupo, datos_estudiantes$Sexo))
cat("\n")

19
6. SECCIÓN 1: ESTADÍSTICA DESCRIPTIVA
6.1. Histograma con Curva de Densidad y Lı́neas de Tendencia
Central

Figura 15: Histograma con curva de densidad y lı́neas de tendencia central

Código en R
# Histograma
hist(datos, main = "Histograma", xlab = "Valores", col = "bisque",
breaks = 15, probability = TRUE)
# A~
nadimos la curva de densidad
lines(density(datos), col = "red", lwd = 2)
# A~
nadimos lı́neas verticales para la media y mediana
abline(v = media, col = "blue", lwd = 2, lty = 2)
abline(v = mediana, col = "darkorange", lwd = 2, lty = 3)
legend("topright", legend = c("Densidad", "Media", "Mediana"),
col = c("red", "blue", "darkorange"), lwd = 2, lty = c(1, 2, 3))

Interpretación
Este gráfico muestra un histograma de los datos simulados, junto con la curva de
densidad en rojo que proporciona una estimación suavizada de la distribución. Las lı́neas
verticales indican dos medidas de tendencia central: la media (lı́nea azul discontinua) y
la mediana (lı́nea verde punteada).
La media se encuentra ligeramente desplazada respecto a la mediana, lo que sugiere
una leve asimetrı́a en los datos. La presencia de dos grupos con medias distintas (uno
alrededor de 100 y otro de 130) genera una forma algo bimodal. Este gráfico es útil para
visualizar la forma de la distribución, la dispersión y la posición de las medidas centrales.

20
6.2. Diagrama de Caja (Boxplot) MEDIA

Figura 16: Diagrama de caja con la media marcada

Código en R
# Diagrama de caja (boxplot)
boxplot(datos, main = "Diagrama de caja", col = "mediumpurple1",
ylab = "Valores")
# A~
nadimos puntos para la media
points(1, media, col = "red", pch = 19, cex = 1.5)
legend("topright", legend = "Media", col = "red", pch = 19)

Interpretación
El diagrama de caja permite visualizar la dispersión, simetrı́a y posibles valores atı́picos
de los datos. Las lı́neas horizontales representan el mı́nimo, el primer cuartil (Q1), la
mediana (Q2), el tercer cuartil (Q3) y el máximo.
En este gráfico, se ha añadido un punto rojo para marcar la ”media”del conjunto de
datos. La posición relativa de la media respecto a la mediana ayuda a detectar la asimetrı́a:
si la media está por encima de la mediana, indica una distribución sesgada a la derecha;
si está por debajo, un sesgo a la izquierda. En nuestro caso, ambas están cercanas, lo
que sugiere una distribución moderadamente simétrica con posible presencia de valores
atı́picos superiores.

21
6.3. Gráfico Q-Q para Evaluar Normalidad

Figura 17: Gráfico Q-Q para evaluar normalidad

Código en R
# Gráfico Q-Q para evaluar normalidad
qqnorm(datos, main = "Gráfico Q-Q Normal")
qqline(datos, col = "olivedrab", lwd = 2)

Interpretación
El gráfico Q-Q compara la distribución de los datos con una distribución normal
teórica. Si los puntos siguen aproximadamente una lı́nea recta, como ocurre aquı́, se puede
asumir que los datos siguen una distribución cercana a la normal. Las ligeras desviaciones
al inicio y al final son comunes en datos reales y no necesariamente indican una violación
severa de la normalidad.

22
6.4. Curva de Densidad con Media y Mediana

Figura 18: Función de densidad con lı́neas: Media y Mediana

Código en R
# Gráfico de densidad
plot(density(datos), main = "Función de densidad",
xlab = "Valores", ylab = "Densidad", lwd = 2)
# A~
nadimos lı́neas verticales para la media y mediana
abline(v = media, col = "cyan3", lwd = 2, lty = 2)
abline(v = mediana, col = "hotpink", lwd = 2, lty = 3)
legend("topright", legend = c("Densidad", "Media", "Mediana"),
col = c("black", "cyan3", "hotpink"), lwd = 2, lty = c(1, 2, 3))

Interpretación
Este gráfico muestra la distribución suavizada de los datos. Se agregan lı́neas verticales
para la media y la mediana, lo que permite evaluar visualmente la simetrı́a. En este caso,
la media y la mediana están relativamente cercanas, lo que respalda la suposición de una
distribución aproximadamente simétrica. La curva de densidad proporciona una visión
más suave y detallada que el histograma.

23
6.5. Datos en R utilizados para los gráficos de SECCIÓN 1:
ESTADÍSTICA DESCRIPTIVA
# Creamos un conjunto de datos simulado sobre rendimiento académico
[Link](123)
n_estudiantes <- 100

datos_estudiantes <- [Link](


ID = 1:n_estudiantes,
Horas_Estudio = round(runif(n_estudiantes, 1, 10), 1),
Asistencia = round(runif(n_estudiantes, 60, 100)),
Grupo = sample(c("A", "B", "C"), n_estudiantes, replace = TRUE),
Sexo = sample(c("M", "F"), n_estudiantes, replace = TRUE, prob = c(0.45, 0.55))
)

# A~
nadir calificación que depende de las variables anteriores (con algo de ruido)
datos_estudiantes$Calificacion <- 40 +
3 * datos_estudiantes$Horas_Estudio +
0.3 * datos_estudiantes$Asistencia +
ifelse(datos_estudiantes$Grupo == "A", 5,
ifelse(datos_estudiantes$Grupo == "B", 0, -5)) +
rnorm(n_estudiantes, 0, 8)

# Asegurar que las calificaciones estén entre 0 y 100


datos_estudiantes$Calificacion <- pmin(pmax(round(datos_estudiantes$Calificacion), 0),

cat("Datos simulados de estudiantes:\n")


print(head(datos_estudiantes))
cat("\n")

cat("Resumen de las variables:\n")


print(summary(datos_estudiantes[, c("Horas_Estudio", "Asistencia", "Calificacion")]))
cat("\n")

cat("Distribución por Grupo y Sexo:\n")


print(table(datos_estudiantes$Grupo, datos_estudiantes$Sexo))
cat("\n")

24
7. Conclusión
A lo largo de este trabajo se desarrollaron distintas secciones que combinaron concep-
tos teóricos con la práctica en RStudio. Se crearon gráficos como histogramas, boxplots,
gráficos de dispersión, curvas de densidad y representaciones asociadas a la distribución
normal, todos con sus respectivos códigos y análisis.
Aunque al inicio fue desafiante organizar todo correctamente (sobre todo entre R y
LaTeX), el proceso permitió afianzar lo aprendido en clase y mejorar la forma de comu-
nicar los resultados. Se notó cómo cambia la interpretación de los datos cuando se ven
representados gráficamente.
Además de reforzar conocimientos sobre estadı́stica descriptiva e inferencia básica,
este trabajo también ayudó a ganar más confianza usando herramientas que al principio
parecı́an complejas.
En resumen, este informe no solo sirvió para cumplir con una entrega académica, sino
también como parte de un proceso en el que aprendı́ bastante, cometı́ errores y mejoré, con
la esperanza de seguir progresando y no decepcionar a quienes nos enseñan con exigencia
y dedicación.

25
8. ANEXOS

Figura 19: Primeros Gráficos

Figura 20: Anexo 02

26
Figura 21: Anexo 03

Figura 22: Estadistica Descriptiva

27
Figura 23: Anexo 05

Figura 24: Anexo 06

28
Figura 25: Anexo 07

Figura 26: Inferencia Estadı́stica

29
Figura 27: Anexo 09

Figura 28: Anexo 10

30

También podría gustarte