0% encontró este documento útil (0 votos)
2 vistas15 páginas

Análisis Gráfico de Datos en RStudio

El informe analiza diversos gráficos generados en RStudio, incluyendo histogramas, boxplots y gráficos de dispersión, para interpretar la distribución de datos en muestras normales y binomiales. Se destaca la normalidad de los datos, la relación entre variables y la presencia de valores atípicos, así como la confirmación del Teorema del Límite Central en la distribución de medias muestrales. Además, se evalúan las calificaciones de estudiantes y su relación con horas de estudio y asistencia, mostrando patrones de rendimiento académico.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas15 páginas

Análisis Gráfico de Datos en RStudio

El informe analiza diversos gráficos generados en RStudio, incluyendo histogramas, boxplots y gráficos de dispersión, para interpretar la distribución de datos en muestras normales y binomiales. Se destaca la normalidad de los datos, la relación entre variables y la presencia de valores atípicos, así como la confirmación del Teorema del Límite Central en la distribución de medias muestrales. Además, se evalúan las calificaciones de estudiantes y su relación con horas de estudio y asistencia, mostrando patrones de rendimiento académico.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Universidad Nacional Hermilio Valdizan

Facultad de Economı́a
Escuela Profesional de Economı́a

INFORME DE LOS GRÁFICOS DE


RSTUDIO
Interpretaciones de los gráficos

Att:
Jean Tucto

1
INFORME DE LOS GRÁFICOS DE RSTUDIO
JEAN PAUL TUCTO ESPINOZA
June 2025

1. Histograma de muestra normal

El histograma de la muestra normal generado refleja la distribución de los


datos a partir de una distribución normal con una media de 100 y una desviación
estándar de 15. A continuación se describen las caracterı́sticas clave observadas:
• Forma de la distribución: El histograma presenta una forma simétrica
que indica que los datos siguen una distribución normal. La mayor con-
centración de datos se encuentra alrededor de la media, con una caı́da
progresiva hacia los extremos, lo que es tı́pico de una distribución normal.
• Centro y dispersión: La media de la muestra es aproximadamente 100,
lo cual es consistente con la media utilizada para generar los datos. La
desviación estándar, de aproximadamente 15, refleja la dispersión de los
datos. Esto se observa en el ancho y la forma de la campana en el his-
tograma.
• Comportamiento de los datos: En una distribución normal, la mayorı́a
de los datos se encuentran cercanos a la media, con pocas observaciones

1
alejadas de ella. Esto se refleja en el histograma, donde las barras centrales
son más altas y las barras laterales son más bajas.
• Evaluación visual de la normalidad: Si se superpusiera una curva
de densidad sobre el histograma, se observarı́a una curva en forma de
campana (la distribución normal), lo que indicarı́a que los datos se ajustan
adecuadamente a una distribución normal.
Esta interpretación sugiere que los datos generados son consistentes con las
propiedades de una distribución normal, lo cual es importante para realizar
inferencias estadı́sticas basadas en esta suposición.

2. Boxplot de muestra normal

El gráfico de caja (boxplot) es una herramienta visual útil para resumir la


distribución de los datos. A continuación se detallan los puntos clave observados
en el boxplot de la muestra normal:
• Caja central (IQR): La caja representa el rango intercuartı́lico (IQR),
que cubre el 50% de los datos. El borde inferior de la caja corresponde al
primer cuartil (Q1, el 25% de los datos), el borde superior a tercer cuartil
(Q3, el 75% de los datos), y la lı́nea dentro de la caja es la mediana (Q2,
el 50% de los datos).
• Simetrı́a y dispersión: En este caso, como los datos siguen una dis-
tribución normal, la caja deberı́a ser aproximadamente simétrica. Esto
indica que los datos están distribuidos de manera equilibrada alrededor de
la mediana. La longitud de los ”bigotes” (lı́neas que se extienden desde la
caja) refleja la dispersión de los datos fuera del rango intercuartı́lico.
• Valores atı́picos: Si los ”bigotes” se extienden mucho o si aparecen
puntos fuera de los mismos, estos puntos podrı́an ser considerados valores

2
atı́picos (outliers). Sin embargo, en una muestra normal, no es común que
aparezcan muchos valores atı́picos, a menos que haya algún sesgo o error
en los datos.
• Mediana y media: La mediana (lı́nea dentro de la caja) es el valor
central de los datos, que divide la distribución en dos partes iguales. En
una distribución normal, la mediana debe coincidir con la media. Si la
mediana se desplazara significativamente de la media, esto indicarı́a una
distribución sesgada.
• Comportamiento general de los datos: El boxplot confirma visual-
mente que los datos siguen una distribución simétrica y que la mayorı́a de
los valores se encuentran concentrados alrededor de la mediana, lo que es
consistente con la forma de una distribución normal.
Este gráfico proporciona una manera clara y rápida de identificar la simetrı́a
de los datos, la dispersión y los valores atı́picos, lo cual es esencial para la
interpretación inicial de una distribución de datos.

3. Gráfico de dispersión (X vs Y)

El gráfico de dispersión muestra la relación entre las variables

e
Y
. A continuación se presentan las observaciones clave:

3
• Relación lineal: Existe una clara relación positiva entre
X
e
Y
, lo que indica que a medida que aumenta
X
, también lo hace
Y
.
• Regresión lineal: La lı́nea de regresión (representada en rojo) se ajusta
bien a los datos, lo que confirma que una regresión lineal es adecuada para
describir la relación entre las dos variables.
• Dispersión de los datos: Aunque la relación es clara, existe algo de
variabilidad en los datos, lo que se refleja en la dispersión de los puntos
alrededor de la lı́nea de regresión.

4. Gráfico de barras (Distribución binomial)

El gráfico de barras representa una distribución binomial con parámetros


n = 10
y
p = 0.5
. A continuación se analizan los puntos más importantes:

4
• Distribución simétrica: La distribución muestra una forma simétrica
centrada alrededor de
5
, que es el valor esperado para una distribución binomial con estos parámetros.
• Frecuencia: La mayor frecuencia se encuentra en los valores cercanos a
la media, con una disminución progresiva a medida que nos alejamos de
la media.
• Caracterı́sticas de la binomial: La distribución binomial es discreta,
por lo que las barras son estrechas y están separadas.

5. Histograma con curva de densidad (datos ejemplo)

El histograma con la curva de densidad muestra la distribución de los datos


de la muestra, junto con la estimación de la densidad. A continuación se pre-
sentan las observaciones clave:
• Forma de la distribución: Los datos tienen una distribución ligera-
mente sesgada a la derecha, lo cual es indicado por la curva de densidad
que se ajusta a los datos, pero se concentra más hacia los valores más
bajos.
• Centro y dispersión: La media de la muestra está ligeramente de-
splazada hacia la derecha de la mediana, lo que refleja un pequeño sesgo
positivo en la distribución. La dispersión es moderada, como se observa
en la amplitud de la curva.
• Comparación entre media y mediana: La media (lı́nea azul) es ligera-
mente mayor que la mediana (lı́nea verde), lo que indica que la distribución
no es perfectamente simétrica.

5
6. Boxplot (datos ejemplo)

El boxplot de los datos muestra la distribución y dispersión de los valores


de la muestra. A continuación se presentan las observaciones clave:
• Mediana y cuartiles: La mediana está cerca del centro del rango in-
tercuartı́lico, lo que indica que los datos están distribuidos de manera
relativamente simétrica.

• Rango intercuartı́lico (IQR): El IQR es moderadamente amplio, lo


que sugiere una dispersión significativa entre el primer y tercer cuartil.
• Valores atı́picos: No se observan valores atı́picos significativos en el
gráfico, lo que sugiere que los datos están relativamente concentrados den-
tro del rango intercuartı́lico.

7. Q-Q Plot (datos ejemplo)

6
El Q-Q plot muestra cómo los datos de la muestra se comparan con una
distribución normal. A continuación se describen las caracterı́sticas clave obser-
vadas:
• Ajuste a la normalidad: Los puntos se ajustan bien a la lı́nea recta, lo
que sugiere que los datos siguen una distribución normal. Las pequeñas
desviaciones al final indican ligeras diferencias con la normalidad, pero en
general los datos son bastante normales.
• Comportamiento de los datos extremos: Aunque la mayorı́a de los
puntos siguen la lı́nea, se observa una leve curvatura en los extremos, lo
que puede sugerir una ligera cola en ambos lados de la distribución.

8. Gráfico de densidad (datos ejemplo)

El gráfico de densidad muestra la distribución continua de los datos, indi-


cando la probabilidad de que se observen ciertos valores. A continuación se
describen los puntos clave:
• Distribución unimodal: La función de densidad indica que los datos
siguen una distribución unimodal, centrada cerca de la media, lo que sug-
iere una concentración de valores alrededor de un punto central.

• Análisis de la dispersión: La dispersión de los datos es moderada, como


se refleja en el ancho de la curva, que no es muy estrecha ni muy ancha.
• Comparación con la media y la mediana: Se observa que la media y
la mediana están alineadas, lo que sugiere que los datos no están sesgados
significativamente.

7
9. Histograma de distribución de población

El histograma de la población muestra una distribución normal con media


cercana a 100 y desviación estándar alrededor de 15, como fue definida en la sim-
ulación. La forma del gráfico permite confirmar que los datos fueron generados
correctamente bajo un modelo normal.

10. Histograma de distribución muestral de la


media
El histograma de las medias muestrales tiene una forma claramente normal,
lo que ejemplifica adecuadamente el Teorema del Lı́mite Central. Incluso si la
población no fuera normal, el promedio de muestras independientes tenderı́a a
distribuirse normalmente para tamaños muestrales suficientemente grandes.

8
9
11. Histograma de distribución de calificaciones

El histograma de calificaciones muestra cómo se distribuyen las calificaciones


entre los estudiantes. A continuación se destacan los puntos más importantes:

• Distribución sesgada a la izquierda: Las calificaciones presentan una


ligera sesgo hacia la izquierda, lo que indica que la mayorı́a de los estudi-
antes tienen calificaciones cercanas a la máxima.
• Comportamiento central: La concentración de estudiantes se encuen-
tra alrededor de las calificaciones más altas, lo que sugiere que el rendimiento
general es alto.
• Pocas calificaciones bajas: Hay muy pocos estudiantes con califica-
ciones bajas, lo que podrı́a indicar que la prueba o evaluación fue fácil.

12. Boxplot de calificaciones por grupo

10
El boxplot de calificaciones por grupo muestra las diferencias en el rendimiento
académico entre los grupos. A continuación se presentan las observaciones clave:
• Diferencias entre grupos: Se observan diferencias notables en las me-
dianas de las calificaciones entre los grupos A, B y C, lo que sugiere que
el grupo puede influir en el rendimiento académico.
• Dispersión dentro de los grupos: La dispersión varı́a entre los grupos,
con el grupo A mostrando una menor dispersión en comparación con los
grupos B y C.
• Valores atı́picos por grupo: Algunos grupos tienen más valores atı́picos,
lo que indica que hay estudiantes con calificaciones significativamente más
altas o más bajas dentro de esos grupos.

13. Dispersión: Horas de estudio vs Calificación

El gráfico de dispersión entre horas de estudio y calificación muestra la


relación entre estas dos variables. A continuación se destacan los puntos clave:
• Relación positiva: Se observa una clara relación positiva, donde el au-
mento en las horas de estudio está asociado con un aumento en las califi-
caciones.
• Ajuste de regresión: La recta de regresión muestra una tendencia clara,
lo que indica que las horas de estudio tienen un impacto directo en el
rendimiento académico.
• Dispersión moderada: Aunque la relación es clara, la dispersión de los
puntos indica que existen otros factores que también afectan las califica-
ciones.

11
14. Dispersión: Asistencia vs Calificación

El gráfico de dispersión entre asistencia y calificación muestra una relación


moderada entre estas dos variables. A continuación se presentan los puntos
clave:
• Relación débil: Aunque existe una relación positiva, la dispersión de los
puntos sugiere que la asistencia no tiene un impacto tan fuerte sobre las
calificaciones como las horas de estudio.

• Ajuste de regresión: La lı́nea de regresión indica una leve tendencia as-


cendente, pero la dispersión en los datos sugiere que otros factores también
juegan un papel importante en el rendimiento.

15. Histograma de distribución de la población


(Simulación de muestra aleatoria)

12
La simulación de la distribución muestral de la media muestra cómo se dis-
tribuyen las medias de muestras extraı́das de una población. La distribución
de las medias muestrales sigue una distribución normal debido al Teorema del
Lı́mite Central, a pesar de que la población subyacente no necesariamente tiene
una distribución normal. Esto se confirma con los histogramas de la población y
las medias muestrales. La media de las medias muestrales es 99.98, que está muy
cerca de la media poblacional de 100, lo que indica que las medias muestrales
son una estimación precisa de la media poblacional.

16. Boxplot (Comparación de medias muestrales


y población)

El histograma de las medias muestrales muestra que, aunque la población


tiene una distribución más amplia, las medias muestrales están agrupadas más
estrechamente alrededor de la media poblacional. Esto es un reflejo del concepto
de error estándar, donde la variabilidad de las medias muestrales es menor que
la variabilidad de la población. The error estimado (2.734) is quite similar to
the valor observed in the media muestrales, which confirms the precision of the
estimates.

17. Q-Q Plot (Evaluación de la normalidad en la


población)
El gráfico Q-Q de la población muestra una ligera desviación de la normalidad,
con los puntos ajustándose bien a la lı́nea recta en su mayorı́a, pero con algunas
pequeñas desviaciones en los extremos. Esto sugiere que la población tiene colas
un poco más gruesas que una distribución normal perfecta, pero sigue siendo
razonablemente cercana a la normalidad.

13
18. Gráfico de densidad (Análisis de correlación
entre variables)

El análisis de correlación entre las horas de estudio, la asistencia y la califi-


cación muestra una correlación moderada entre horas de estudio y calificación
(
r = 0.667
), lo que sugiere que el tiempo dedicado al estudio está fuertemente relacionado
con las calificaciones. La correlación entre asistencia y calificación es más débil
(
r = 0.237
), indicando que la asistencia tiene una relación más débil con las calificaciones
en comparación con las horas de estudio.

14

También podría gustarte