MÁSTER UNIVERSITARIO EN HISTORIA, GEOGRAFÍA Y
PATRIMONIO
ESTADÍSTICA APLICADA
MANUAL BÁSICO DE R STUDIO
RAMÓN PELLITERO ONDICOL
JOAQUÍN OSORIO ARJONA
La estadística en R-Studio
❑R-Studio es una interfaz gratuita, abierta y sin
licencia orientada al análisis estadístico.
❑Mientras que algunas de las operaciones
estadísticas más complejas requieren de un
considerable tiempo y esfuerzo para realizarse en
Excel, podemos realizar estas mismas operaciones en
Rstudio con solo una línea de comando y en 10
segundos.
La estadística en R-Studio
❑En la asignatura de Estadística Aplicada
utilizaremos R-Studio para realizar algunos de los
ejercicios más complejos de las PEC de manera
fácil y sencilla.
❑No se va a pedir en la asignatura el aprendizaje
o dominio de esta interfaz ni tampoco se va a
pedir al alumno a programar.
La estadística en R-Studio
❑Descargaremos R-Studio del siguiente enlace:
[Link]
❑R-Studio requiere la descarga de dos
componentes: el lenguaje R y la interfaz R-
Studio. Ambos están disponibles en el enlace de
arriba.
La estadística en R-Studio
❑El cuadro de arriba a la izquierda es donde ejecutamos los
comandos (para que aparezca tenéis que presionar File, New
File, y R Script. Podéis guardar y reutilizar los comandos que
pongáis).
❑El cuadro de abajo a la izquierda es donde salen los
resultados de los comandos ejecutados.
❑El cuadro de arriba a la derecha es donde veremos los datos
que vayamos cargando o creando.
❑El cuadro de abajo a la derecha es donde se verán los
gráficos que se hagan y donde podemos también instalar
librerías en caso de que hiciese falta.
La carga de datos
❑Aseguraos de tener una carpeta en Documentos
donde tengáis los datos que vayáis a usar, y que la
carpeta tenga nombre sencillo.
❑Podemos definir dicha carpeta como carpeta de
directorio en Rstudio para no tener que estar
poniendo el nombre de la carpeta sino solamente el
nombre de la tabla a usar.
❑Para ello en Rstudio, pinchad en Session, Set
Working Directory, y elegís la carpeta con vuestros
datos.
La carga de datos
❑Rstudio puede importar datos de varios
formatos de Excel, pero el más sencillo y fácil de
usar es el formato .csv.
❑Es muy aconsejable que guardéis las hojas de
cálculo Excel que queréis importar a Rstudio
como ficheros csv delimitados por comas.
La carga de datos
❑data <- [Link](file =
'[Link]', header = TRUE,
sep = ';')
❑Aseguraos de que los datos
numéricos una vez importados
estén en formato num
(simplemente mirando que
aparezca num en los datos
cargados arriba a la derecha).
La carga de datos
❑Si los datos se han cargado y están en formato texto y no numérico
veremos chr en vez de num.
❑En ese caso primero escribid y ejecutad esta línea: library(dplyr)
❑Una vez cargada dicha librería, copiad y ejecutad este comando:
data <- data %>%
mutate(across(
.cols = where([Link]),
.fns = ~ [Link](gsub(",", ".", gsub("\\.", "", .)))
))
La carga de datos
❑En el caso de que queráis mantener algunas
columnas clave como id o una columna con nombres
en caracteres y no numérico, copiad y ejecutad este
comando:
data <- data %>%
mutate(across(
.cols = -all_of(c("id", "nombre", "fecha")),
.fns = ~ [Link](gsub(",", ".", gsub("\\.", "", .)))
))
La carga de datos
❑Si luego necesitáis trabajar con solo los
campos numéricos (como será el caso con las
matrices de correlación), podéis crear una
segunda tabla con solo los campos numéricos
con esta línea:
data_num <- data[sapply(data, [Link])]
La exportación de datos
❑[Link](data, "mi_archivo.csv", [Link] =
FALSE)
❑Se creará un fichero csv en Excel en la carpeta
directorio con los datos seleccionados.
La representación gráfica
Nombre comando Explicación
hist(data$campo) Histograma
barplot(data$campo) Gráfico de barras
boxplot(data$campo) Gráfico de cajas y bigotes
corrplot(data, method = "color", Matriz de correlación (requiere
[Link] = "black", [Link] = de librería corrplot)
"black")
plot(data$campo1, Gráfico de dispersión
data$campo2)
La representación gráfica
❑herramienta(data,
main = “título del
gráfico", xlab = “título
del eje x", col = “color")
❑hist(normales, main =
"Distribución Normal",
xlab = "Valores", col =
“blue")
La representación gráfica
❑Selección de variables de interés
para una matriz de correlación:
❑Paso 1: variables <- c("campo1",
"campo2", "campo3", "campo4", …)
❑Paso 2: sub_data <- data[,variables]
❑Paso 3: matriz <- cor(sub_data,
method = "pearson")
❑Paso 4: corrplot(corr_matrix,
method = "color", [Link] = "black", [Link]
= 45, [Link] = "black")
El análisis exploratorio de datos
Nombre comando Explicación
summary(data) Resumen de datos
min(data$campo) Mínimo
max(data$campo) Máximo
range(data$campo) Rango
quantile(data$campo, 0.25) Primer cuartil
quantile(data$campo, 0.75) Tercer cuartil
IQR(data$campo) Rango intercuartílico
El análisis exploratorio de datos
Nombre comando Explicación
mean(data$campo) Media
median(data$campo) Mediana
length(data$campo) Tamaño
var(data$campo) Varianza
sd(data$campo) Desviación típica
skewness(data$campo) Asimetría (requiere librería moments)
kurtosis(data$campo) Curtosis (requiere librería moments)
El análisis entre dos variables
Nombre comando Explicación
cov(data$campo1, data$campo2) Covarianza
cov(data) Matriz de covarianza
cor(data$campo1, data$campo2, method = Correlación de Pearson
‘pearson’)
cor(data, method = ‘pearson’) Matriz de correlación de Pearson
cor(data$campo1, data$campo2, method = Correlación de Spearman
‘spearman’)
cor(data, method = ‘spearman’) Matriz de correlación de Spearman
El análisis entre dos variables
Nombre comando Explicación
regresion <- lm(campo1 ~ campo2, data = data) Modelo de regresión lineal simple
regresion <- lm(campo1 ~ campo2 + campo 3 + Modelo de regresión lineal múltiple
campo4 +..., data = data)
regresion <- lm(campo1 ~ (campo2, 3), data = Modelo de regresión cúbico
data)
regresion <- lm(log(campo1) ~ campo2, data = Modelo de regresión exponencial
data)
regresion <- lm(campo1 ~ log(campo2), data = Modelo de regresión logarítmico
data)
fitted(regresion) Valores predichos por el modelo de regresión
residuals(regresion) Valores residuales del modelo de regresión
La representación gráfica
❑summary(regresion) para ver
los datos del modelo de
regresión lineal que hemos
llamado regresion (si lo hemos
llamado model, se pondría
summary(model) )
❑Los dos coeficientes en
Estimate son los coeficientes
de la línea de tendencia del
modelo.
El análisis entre dos variables
❑plot(data$campo1,
data&campo2, xlab = “Título eje
x", ylab = “Título eje y", main =
“Título gráfico")
abline(regresion, col = “color", lwd
= número de ancho de línea
❑plot(alabama_num$[Link]
y, alabama_num$Diabetes, xlab
= "Adult obesity", ylab =
"Diabetes", main = "Regresión
simple")
abline(regresion, col = "red", lwd
=2
Estadística inferencial
Nombre comando Explicación
normales <- rnorm(x, mean = 0, sd = 1) Distribución normal de un número x de datos
binomiales <- rbinom(x, size = y, prob = z) Distribución binomial de un número x de datos con un
número y de ensayos y una probabilidad z de éxito
poisson <- rpois(x, lambda = y) Distribución de Poisson de un número x de datos con
un número y de media y varianza
[Link](data$campo1, data$campo2, paired = TRUE) Test t de Student
[Link](data$campo1, data$campo2, método = Test de correlación de Pearson
‘pearson’)
[Link](data$campo1, data$campo2, método = Test de correlación de Spearman
‘spearman’)
Estadística inferencial
❑Para el test chi cuadrado, primer paso:
convertir los valores de los campos de estudio
en categorías en dos nuevos campos:
data$campo_nuevo_1 <- ifelse(data$campo1 >
mean(data$campo1), "Alta", "Baja")
data$campo_nuevo_2 <- ifelse(data$campo2 >
mean(data$campo1), "Alta", "Baja")
Estadística inferencial
❑El segundo paso es crear una tabla de
contingencia:
tabla <- table(data$campo_nuevo_1,
data$campo_nuevo_2)
Nombre comando Explicación
[Link](tabla) Test de Chi cuadrado de la
tabla de contingencia creada