0% encontró este documento útil (0 votos)
9 vistas25 páginas

Introducción a R-Studio para Estadística

El manual básico de R Studio proporciona una guía para utilizar esta herramienta de análisis estadístico, destacando su facilidad de uso en comparación con Excel. Se abordan aspectos como la carga de datos, la representación gráfica y el análisis exploratorio, así como comandos específicos para realizar diversas operaciones estadísticas. Además, se incluye información sobre la estadística inferencial y la creación de modelos de regresión.

Cargado por

rquinteir2
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
9 vistas25 páginas

Introducción a R-Studio para Estadística

El manual básico de R Studio proporciona una guía para utilizar esta herramienta de análisis estadístico, destacando su facilidad de uso en comparación con Excel. Se abordan aspectos como la carga de datos, la representación gráfica y el análisis exploratorio, así como comandos específicos para realizar diversas operaciones estadísticas. Además, se incluye información sobre la estadística inferencial y la creación de modelos de regresión.

Cargado por

rquinteir2
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

MÁSTER UNIVERSITARIO EN HISTORIA, GEOGRAFÍA Y

PATRIMONIO

ESTADÍSTICA APLICADA

MANUAL BÁSICO DE R STUDIO

RAMÓN PELLITERO ONDICOL

JOAQUÍN OSORIO ARJONA


La estadística en R-Studio
❑R-Studio es una interfaz gratuita, abierta y sin
licencia orientada al análisis estadístico.
❑Mientras que algunas de las operaciones
estadísticas más complejas requieren de un
considerable tiempo y esfuerzo para realizarse en
Excel, podemos realizar estas mismas operaciones en
Rstudio con solo una línea de comando y en 10
segundos.
La estadística en R-Studio
❑En la asignatura de Estadística Aplicada
utilizaremos R-Studio para realizar algunos de los
ejercicios más complejos de las PEC de manera
fácil y sencilla.
❑No se va a pedir en la asignatura el aprendizaje
o dominio de esta interfaz ni tampoco se va a
pedir al alumno a programar.
La estadística en R-Studio
❑Descargaremos R-Studio del siguiente enlace:
[Link]
❑R-Studio requiere la descarga de dos
componentes: el lenguaje R y la interfaz R-
Studio. Ambos están disponibles en el enlace de
arriba.
La estadística en R-Studio
❑El cuadro de arriba a la izquierda es donde ejecutamos los
comandos (para que aparezca tenéis que presionar File, New
File, y R Script. Podéis guardar y reutilizar los comandos que
pongáis).
❑El cuadro de abajo a la izquierda es donde salen los
resultados de los comandos ejecutados.
❑El cuadro de arriba a la derecha es donde veremos los datos
que vayamos cargando o creando.
❑El cuadro de abajo a la derecha es donde se verán los
gráficos que se hagan y donde podemos también instalar
librerías en caso de que hiciese falta.
La carga de datos
❑Aseguraos de tener una carpeta en Documentos
donde tengáis los datos que vayáis a usar, y que la
carpeta tenga nombre sencillo.
❑Podemos definir dicha carpeta como carpeta de
directorio en Rstudio para no tener que estar
poniendo el nombre de la carpeta sino solamente el
nombre de la tabla a usar.
❑Para ello en Rstudio, pinchad en Session, Set
Working Directory, y elegís la carpeta con vuestros
datos.
La carga de datos
❑Rstudio puede importar datos de varios
formatos de Excel, pero el más sencillo y fácil de
usar es el formato .csv.
❑Es muy aconsejable que guardéis las hojas de
cálculo Excel que queréis importar a Rstudio
como ficheros csv delimitados por comas.
La carga de datos
❑data <- [Link](file =
'[Link]', header = TRUE,
sep = ';')
❑Aseguraos de que los datos
numéricos una vez importados
estén en formato num
(simplemente mirando que
aparezca num en los datos
cargados arriba a la derecha).
La carga de datos
❑Si los datos se han cargado y están en formato texto y no numérico
veremos chr en vez de num.
❑En ese caso primero escribid y ejecutad esta línea: library(dplyr)
❑Una vez cargada dicha librería, copiad y ejecutad este comando:
data <- data %>%
mutate(across(
.cols = where([Link]),
.fns = ~ [Link](gsub(",", ".", gsub("\\.", "", .)))
))
La carga de datos
❑En el caso de que queráis mantener algunas
columnas clave como id o una columna con nombres
en caracteres y no numérico, copiad y ejecutad este
comando:
data <- data %>%
mutate(across(
.cols = -all_of(c("id", "nombre", "fecha")),
.fns = ~ [Link](gsub(",", ".", gsub("\\.", "", .)))
))
La carga de datos
❑Si luego necesitáis trabajar con solo los
campos numéricos (como será el caso con las
matrices de correlación), podéis crear una
segunda tabla con solo los campos numéricos
con esta línea:
data_num <- data[sapply(data, [Link])]
La exportación de datos
❑[Link](data, "mi_archivo.csv", [Link] =
FALSE)
❑Se creará un fichero csv en Excel en la carpeta
directorio con los datos seleccionados.
La representación gráfica
Nombre comando Explicación
hist(data$campo) Histograma
barplot(data$campo) Gráfico de barras
boxplot(data$campo) Gráfico de cajas y bigotes
corrplot(data, method = "color", Matriz de correlación (requiere
[Link] = "black", [Link] = de librería corrplot)
"black")
plot(data$campo1, Gráfico de dispersión
data$campo2)
La representación gráfica
❑herramienta(data,
main = “título del
gráfico", xlab = “título
del eje x", col = “color")
❑hist(normales, main =
"Distribución Normal",
xlab = "Valores", col =
“blue")
La representación gráfica
❑Selección de variables de interés
para una matriz de correlación:
❑Paso 1: variables <- c("campo1",
"campo2", "campo3", "campo4", …)
❑Paso 2: sub_data <- data[,variables]
❑Paso 3: matriz <- cor(sub_data,
method = "pearson")
❑Paso 4: corrplot(corr_matrix,
method = "color", [Link] = "black", [Link]
= 45, [Link] = "black")
El análisis exploratorio de datos
Nombre comando Explicación
summary(data) Resumen de datos
min(data$campo) Mínimo
max(data$campo) Máximo
range(data$campo) Rango
quantile(data$campo, 0.25) Primer cuartil
quantile(data$campo, 0.75) Tercer cuartil
IQR(data$campo) Rango intercuartílico
El análisis exploratorio de datos
Nombre comando Explicación
mean(data$campo) Media
median(data$campo) Mediana
length(data$campo) Tamaño
var(data$campo) Varianza
sd(data$campo) Desviación típica
skewness(data$campo) Asimetría (requiere librería moments)
kurtosis(data$campo) Curtosis (requiere librería moments)
El análisis entre dos variables
Nombre comando Explicación
cov(data$campo1, data$campo2) Covarianza
cov(data) Matriz de covarianza
cor(data$campo1, data$campo2, method = Correlación de Pearson
‘pearson’)
cor(data, method = ‘pearson’) Matriz de correlación de Pearson
cor(data$campo1, data$campo2, method = Correlación de Spearman
‘spearman’)
cor(data, method = ‘spearman’) Matriz de correlación de Spearman
El análisis entre dos variables
Nombre comando Explicación
regresion <- lm(campo1 ~ campo2, data = data) Modelo de regresión lineal simple
regresion <- lm(campo1 ~ campo2 + campo 3 + Modelo de regresión lineal múltiple
campo4 +..., data = data)
regresion <- lm(campo1 ~ (campo2, 3), data = Modelo de regresión cúbico
data)
regresion <- lm(log(campo1) ~ campo2, data = Modelo de regresión exponencial
data)
regresion <- lm(campo1 ~ log(campo2), data = Modelo de regresión logarítmico
data)
fitted(regresion) Valores predichos por el modelo de regresión
residuals(regresion) Valores residuales del modelo de regresión
La representación gráfica
❑summary(regresion) para ver
los datos del modelo de
regresión lineal que hemos
llamado regresion (si lo hemos
llamado model, se pondría
summary(model) )
❑Los dos coeficientes en
Estimate son los coeficientes
de la línea de tendencia del
modelo.
El análisis entre dos variables
❑plot(data$campo1,
data&campo2, xlab = “Título eje
x", ylab = “Título eje y", main =
“Título gráfico")
abline(regresion, col = “color", lwd
= número de ancho de línea
❑plot(alabama_num$[Link]
y, alabama_num$Diabetes, xlab
= "Adult obesity", ylab =
"Diabetes", main = "Regresión
simple")
abline(regresion, col = "red", lwd
=2
Estadística inferencial
Nombre comando Explicación
normales <- rnorm(x, mean = 0, sd = 1) Distribución normal de un número x de datos
binomiales <- rbinom(x, size = y, prob = z) Distribución binomial de un número x de datos con un
número y de ensayos y una probabilidad z de éxito
poisson <- rpois(x, lambda = y) Distribución de Poisson de un número x de datos con
un número y de media y varianza
[Link](data$campo1, data$campo2, paired = TRUE) Test t de Student
[Link](data$campo1, data$campo2, método = Test de correlación de Pearson
‘pearson’)
[Link](data$campo1, data$campo2, método = Test de correlación de Spearman
‘spearman’)
Estadística inferencial
❑Para el test chi cuadrado, primer paso:
convertir los valores de los campos de estudio
en categorías en dos nuevos campos:
data$campo_nuevo_1 <- ifelse(data$campo1 >
mean(data$campo1), "Alta", "Baja")
data$campo_nuevo_2 <- ifelse(data$campo2 >
mean(data$campo1), "Alta", "Baja")
Estadística inferencial
❑El segundo paso es crear una tabla de
contingencia:
tabla <- table(data$campo_nuevo_1,
data$campo_nuevo_2)
Nombre comando Explicación
[Link](tabla) Test de Chi cuadrado de la
tabla de contingencia creada

También podría gustarte