Apunte de contenido
Introducción a R
USS
Facultad de Economía y Gobierno
Santiago, Chile
1. Introducción
1.1 Lenguaje de Programación R
R es un lenguaje de programación y un entorno de cálculo estadístico
libre y de código abierto desarrollado por el R CoreTeam. Es una herramienta
poderosa para el análisis de datos, la visualización y la creación de modelos
estadísticos.
1.2 ¿Qué es R?
R es un lenguaje de programación de propósito general que se utiliza
principalmente para el análisis de datos y la estadística. Es un lenguaje
interpretado, lo que significa que no necesita ser compilado antes de su
ejecución. Esto lo hace rápido y fácil de aprender.
1.3 ¿Para qué se utiliza R?
R se utiliza para una amplia gama de tareas de análisis de datos,
incluyendo:
● Manipulación de datos: R puede ser utilizado para leer, escribir y
manipular datos de una variedad de fuentes, incluyendo archivos de
texto, bases de datos y hojas de cálculo.
● Análisis estadístico: R proporciona una amplia gama de funciones
estadísticas para realizar análisis de datos descriptivos e inferenciales.
● Visualización de datos: R proporciona una amplia gama de funciones
para crear gráficos y visualizaciones de datos.
Pág. 2
2. Datos en R
2.1 Datos Atómicos
Los datos atómicos son los datos más básicos que se pueden almacenar
en R. Son datos indivisibles que no pueden descomponerse en partes más
pequeñas. Los datos atómicos pueden ser de cuatro tipos:
2.1.1 Numéricos
Los datos numéricos representan valores numéricos, como números
enteros, números decimales y números complejos.
● Enteros: los datos enteros son números que no tienen decimales.
● Decimales: los datos decimales son números que tienen decimales.
● Complejos: los datos complejos son números que tienen una parte real
y una parte imaginaria.
Ejemplos:
# Enteros
1 x <- 1
2 y <- 2
3
4 # Decimales
5 z <- 1.0
6 w <- 2.5
7
8 # Complejos
9 a <- 1 + 2i
10 b <- 3 - 4i
11
2.1.2 Lógicos
Los datos lógicos representan valores lógicos, como TRUE o FALSE.
Ejemplos:
1 x <- TRUE
2 y <- FALSE
Pág. 3
2.1.3 Carácter
Los datos de carácter representan cadenas de texto.
Ejemplo:
1 x <- "Hola, mundo!"
2 y <- 'Este es un ejemplo'
2.1.4 Nulo
Los datos nulos representan valores que no están definidos.
Ejemplo:
1 x <- NULL
2.2 Datos estructurados
Los datos estructurados son datos que están organizados en una
estructura. Los datos estructurados pueden ser de dos tipos:
2.2.1 Vectores
Los vectores son arreglos unidimensionales de datos del mismo tipo.
Los vectores se pueden crear usando la función c()
Ejemplo:
1 x <- c(1, 2, 3)
2 y <- c("Hola", "mundo")
3 z <- c(TRUE, FALSE)
2.2.2 Matrices
Las matrices son arreglos bidimensionales de datos del mismo tipo.
Una matriz es un objeto que contiene un conjunto de números u otros
objetos ordenados en filas y columnas. Las matrices se pueden utilizar para
representar una variedad de datos, como datos estadísticos, datos de
imágenes y datos de redes.
Ejemplo:
x <- matrix(1:9, nrow = 3, ncol = 3)
1 y <- matrix(c("Hola", "mundo", "Adiós"), nrow = 3, ncol = 1)
2
Pág. 4
2.2.3 Listas
Las listas son arreglos heterogéneos de datos de cualquier tipo. Una lista
es un objeto que contiene un conjunto de objetos de R, que pueden ser de
cualquier tipo. A diferencia de los vectores y las matrices, donde los elementos
deben ser del mismo tipo, en el caso de las listas los elementos pueden ser de
un tipo diferente o almacenar distintas estructuras.
Una lista en R se define como un objeto de la clase "list". Para crear una
lista, se utiliza la función list(). La función list() toma un número arbitrario
de argumentos, cada uno de los cuales puede ser un objeto de R.
Ejemplo:
1 x <- list(1, "Hola", TRUE)
2 y <- list(x, y, z)
2.2.4 Data frames
Los Data Frames son arreglos bidimensionales de datos de diferentes
tipos. Un Data Frame es una estructura de datos que contiene una colección
de variables de la misma longitud, almacenadas en filas y columnas. Los Data
Frames son una forma flexible de almacenar datos de diferentes tipos, como
números, caracteres, factores y fechas.
Un Data Frame en R se define como un objeto de la clase "[Link]".
Para crear un Data Frame, se utiliza la función [Link](). La función
[Link]() toma un número arbitrario de argumentos, cada uno de los
cuales puede ser un vector de cualquier tipo.
Ejemplo:
x <- [Link](
nombre = c("Juan", "María", "Pedro"),
edad = c(20, 25, 30)
)
Pág. 5
Los datos y los tipos de datos son fundamentales para el análisis de
datos en R. Es importante comprender los diferentes tipos de datos
disponibles en R y cómo se pueden utilizar para representar diferentes tipos
de datos.
3. Operadores
Los operadores, en el lenguaje de programación R, son símbolos o
caracteres especiales que se utilizan para realizar operaciones y
manipulaciones en los datos. Aquí te proporciono una descripción de los
operadores más comunes en R.
3.1 Operadores de Asignación:
● <-o =: asigna un valor a una variable. Por ejemplo, x <- 5 asigna 5 a la
variable x.
3.2 Operadores Aritméticos:
● + (Suma): suma dos valores.
● - (Resta): resta el segundo valor del primero.
● * (Multiplicación): multiplica dos valores.
● / (División): divide el primer valor por el segundo.
● ^ (Exponente): eleva el primer valor a la potencia del segundo.
● %% (Módulo): devuelve el residuo de la división del primer valor entre el
segundo.
● %/% (División entera): devuelve la parte entera de la división del primer
valor entre el segundo.
3.3 Operadores de Comparación:
● == (Igual a): comprueba si dos valores son iguales.
● != (No igual a): comprueba si dos valores son diferentes.
● < (Menor que): comprueba si el primer valor es menor que el segundo.
Pág. 6
● > (Mayor que): comprueba si el primer valor es mayor que el segundo.
● <=(Menor o igual que): comprueba si el primer valor es menor o igual
que el segundo.
● >=(Mayor o igual que): comprueba si el primer valor es mayor o igual
que el segundo.
3.4 Operadores Lógicos:
● & (AND lógico): devuelve TRUE si ambas condiciones son TRUE.
● | (OR lógico): devuelve TRUE si al menos una de las condiciones es TRUE.
● ! (NOT lógico): niega una condición (TRUE se convierte en FALSE y
viceversa).
3.5 Operadores de Concatenación:
● c() (Concatenación): se utiliza para combinar vectores en uno solo.
3.6 Operadores de Indexación:
● [ ]:
se utiliza para acceder a elementos específicos de vectores,
matrices, listas y data frames.
3.7 Operadores Especiales:
● : (Secuencia): crea una secuencia de números enteros, por ejemplo, 1:5
genera 1, 2, 3, 4, 5.
● %in%: comprueba si un valor está presente en un vector o lista.
● %*%: realiza la multiplicación de matrices.
3.8 Operadores de Asignación Compuesta:
● +=, -=, *=, /=:
realizan una operación y luego asignan el resultado a la
variable en un solo paso. Por ejemplo, x += 2 es equivalente a x = x + 2.
Pág. 7
4. Ejemplos Prácticos
4.1 Operadores básicos y uso de variables
# Declaración de dos variables numéricas
x <- 10
y <- 20
# Realización de operaciones aritméticas
suma <- x + y
resta <- x - y
multiplicacion <- x * y
division <- x / y
modulo <- x %% y
exponente <- x ^ y
# Visualización los resultados
print(suma)
30
print(resta)
-10
print(multiplicacion)
200
print(division)
0.5
print(modulo)
0
print(exponente)
10^20
4.2 Ejemplos con medidas de tendencia y dispersión estadísticas
Los estadísticos descriptivos son medidas que resumen los datos de un
conjunto de datos. Las funciones estadísticas de R se pueden utilizar para
calcular una variedad de estadísticos descriptivos, como la media, la desviación
estándar, la mediana, la moda y el rango.
Pág. 8
4.2.1 Media
Corresponde a la suma de todos los valores de un conjunto de datos
dividida por el número de valores. La función mean() se utiliza para calcular la
media de un conjunto de datos.
x <- c(1, 2, 3, 4, 5)
media <-
mean(x)
print(media)
Salida:
3
4.3 Mediana
La mediana es el valor que divide un conjunto de datos ordenado en dos
partes iguales. La función median() se utiliza para calcular la mediana de un
conjunto de datos.
x <- c(1, 2, 3, 4, 5)
mediana <-
median(x)
print(mediana)
Salida:
3
4.4 Moda
La moda es el valor que aparece con mayor frecuencia en un conjunto
de datos. La función mode() se utiliza para calcular la moda de un conjunto de
datos.
x <- c(1, 2, 3, 3, 5)
moda <-
mode(x)
print(moda)
Salida:
3
Pág. 9
4.5 Rango
El rango es la diferencia entre el valor máximo y el valor mínimo de un
conjunto de datos. La función range() se utiliza para calcular el rango de un
conjunto de datos.
x <- c(1, 2, 3, 4, 5)
rango <-
range(x)
print(rango)
Salida:
(1, 5)
4.6 Varianza
La varianza es una medida de la dispersión de los datos alrededor de la
media. La función var() se utiliza para calcular la varianza de un conjunto de
datos.
x <- c(1, 2, 3, 4, 5)
varianza <-
var(x)
print(varianza)
Salida:
2.5
4.7 Desviación estándar
La desviación estándar es una medida de la dispersión de los datos
alrededor de la media. La función sd() se utiliza para calcular la desviación
estándar de un conjunto de datos.
x <- c(1, 2, 3, 4, 5)
desviacion_estandar <-
sd(x)
print(desviacion_estand
ar)
Salida:
1.581139
Pág. 10
4.8 Pruebas Estadísticas
Las pruebas estadísticas se utilizan para evaluar la hipótesis de que dos
o más grupos son iguales. Las funciones estadísticas de R se pueden utilizar
para realizar una variedad de pruebas estadísticas, como la prueba t, la prueba
de chi-cuadrado y la prueba de ANOVA.
grupo_1 <- c(1, 2, 3, 4, 5)
grupo_2 <- c(6, 7, 8,
9, 10) [Link](grupo_1,
grupo_2)
Salida:
t = -5, df = 8, p-value = 0.001053
Pág. 11
Referencias Bibliográficas
Santana, J. S., y Farfán, E. M. (2014). El arte de programar en R “Un lenguaje
para la estadística”. Instituto Mexicano de Tecnología del Agua.
[Link]
mar_en_R.pdf
Shmueli, G., Bruce, P., Yahav, I., Patel, N., Lichtendahl, K. (2018). Data Mining for
Bussiness Analytics. Concepts, Techniques, and Applications in R. Wiley.
Spector, P. (2008). Data manipulation with R (Vol. 1). Springer.
Pág. 12