LENGUAJE DE
PROGRAMACIÓN R
Herramienta para el análisis de datos
Formador/Consultor: Gustavo Herreros
Objetivo
En este programa aprenderás a realizar
manipulaciones y representaciones
sofisticadas de datos, crear informes e
aprender a aplicar algunas técnicas
modernas de análisis de datos
Temario
Primeros pasos con R
•
•
El ecosistema de R
Vectores, listas y matrices
01
• Data frames
4 horas
Visualización:
Gráficos con R
• Primeros gráficos con R. Creación de gráficos
02
sencillos y rápidos con la función plot
• Gráficos avanzados: Introducción a ggplot, una
de las librerías más potentes de visualización.
2 horas
Introducción a la
Estadística
03
con R
• Descripción de las variables
• Medidas de tendencia central, dispersion y posición
• Estandarizado y normalización de los datos
• Frecuencias
• Test estadísticos
3 horas
Temario
Modelos
•
•
Correlación
Regresión lineal
04
• Validación cruzada
• Medidas de error
• Predicción
• Series temporales
• Manipulación de series temporales
• Visualización
• Medias móviles
• Descomposición de series temporales
4 horas
Fuentes de datos
• Logs, CSV, SQL, APIS (Google Analytics, Search
Console, Twitter, etc.)
05
• Web scrapping
• Análisis reproducibles
• 2horas
Reporting
• Introducción a R MarkdownIntroducción a
Shiny
0
6
1 hora y 30 minutos
Tema 1.1
Primeros pasos en R
Primeros pasos con R
• Nuestros paneles
1.1.-Primeros pasos con R
• Al abrir …
Primer paso Segundo paso
1.1.-Primeros pasos con R
Ejemplo
1.1 Primeros pasos con R
• Script
Vamos a ir al planel de Script
¿Qué es un script?. Script o guión, es una secuencia de
instrucciones generalmente almacenadas en un archivo de texto
que deben ser interpretados línea a línea en tiempo real para su
ejecución.
Primer ejercicio Segundo ejercicio
Vamos a resolver una ecuación Usar el Teorema de Pitágoras, para el
de segundo grado, cuyos cálculo de uno de sus catetos,
coeficientes son: a=.1, b=2 y c= conociendo que la hipotenusa = 10 y
uno de ellos es 8
-2
Primeros pasos con R
• Paquetes y librerías
En este punto queremos … instalar el paquete ‘caret’
Este paquete (Classification And REgression Training ), desarrollado por Max Kuhn, es una
interfaz que unifica bajo un único marco cientos de funciones de distintos paquetes, facilitando en
gran medida todas las etapas de de preprocesado, entrenamiento, optimización y validación de
modelos predictivos
Primer paso
Verificamos si se encuentra en el panel “librerías, ayuda,
directorio …”. Si está dar, un check,
Segundo paso
En caso contrario, colocar el siguiente comando en consola,
[Link](“caret”)
Tercer paso
Verificamos, que se ha instalado el paquete ‘caret’
¿Qué hacer?
Primeros pasos con R
• Paquetes y librerías
[Link]
Primeros pasos con R
• Paquetes y librerías
Vamos a buscar las funciones del paquete “tsfknn”
Tema 1.2
Vectores, listas y matrices
16
Vectores
17
1.2 Vectores, listas y matrices
18
Matrices
19
20
21
1.2 Vectores, listas y matrices
(Ejercicios)
Ejercicios de operación de vectores
1.-Generar la suma de los 30 primeros números naturales, del vector v1.
2.-Generar la suma de la función v1^3-1, a este nuevo vector lo llamaremos v2.
Ejercicio de lista.
1.- Generar la lista, en dónde el alumno, Luis, tiene las siguientes notas: 5.6, 7.8, 9.1, 8.3; vive en Madrid y está
casado
Ejercicio de matrices.
[Link] tres matrices invertibles, de orden 3x3. Calcula en
un Sistema de ecuaciones lineales cuyos valores de los coeficientes c(1,3,1), los valores de las variables: x,y,z
Tema 1.3
Dataframes
1.3.- Dataframes
[Link]
59i10
(Artículo de Hadley Wickham)
25
1.3.- Dataframes. Al ver el
objeto…
26
1.3.- Dataframes. Tipos de
datos
Datos cualitativos
• Ordinales.
Escalafón docente, orden de llegada de personas a una meta, etc…
En R lo guardaremos como factores ordenados
• Atributo.
Sexo, DNI, tipo de flor, etc…
En R lo guardaremos en vectores de factores
Datos cuantitativos
• De intervalo o escala.
Temperatura, peso de una persona, edades, etc…
• De relación
Proporción, índice, porcentaje, etc…
En R lo guardaremos en vectores numéricos
27
[Link]
r_iris
28
[Link]
29
30
31
32
1.3.- Dataframes. Ejercicios
1.-Importar el dataframe
Audiology (Original), de la página web:
[Link]
2.- Exportar el dataframe ‘Iris’, que hemos trabajado en clase.
3.- Crear un dataframe, de orden 6x2, una variable debe ser
categórica y la otra numérica. Modificar en la segunda columna,
el tercer registro. Añadir una nueva columna, la misma debe ser
numérica.
Tema 2
Visualización
34
35
36
Gráficos avanzados con ggplot
• Usaremos la función ggplot para realizar gráficos avanzados. Primeramente
debemos instalar el paquete “ggplot2”.
• Creamos primeramente el contenedor, vital para este tipo de gráfico
• Incorporamos los datos, los ejes y una capa por cada gráficoque se
quiera dibujar, es decir:
data: es el conjunto de datos a usar o [Link]
aes: configuración de los ejes y especificar las etiquetas de los ejes
Por ejemplo, para el conjunto de datos denominado “iris” (que contiene
datos sobre 3 especies de esta planta): iris setosa, iris versicolor e iris
virginica. En este caso, representaremos la totalidad de los datos
buscando un patrón entre “[Link]” y “[Link]”.
Tema 3
Introducción a la estadística con R.
Estadística descriptiva y algo más
38
39
40
41
42
43
44
45
46
47
48
49
50
51
Los test estadísticos
• Son pruebas matemáticas que se aplican a las estadísticas para determinar su
grado de certeza y significado
• Vamos a usar los métodos deductivos paramétricos
Para ello, testearemos la hipótesis estadística que las distribuciones de
las variables determinadas tienen ciertas características.
La muestra debe ser aleatoria, la distribución de la frecuencia debe ser
normal y el nivel de medición debe ser racional.
Nota: Cuando las pruebas estadísticas aplicables a las variables
cuantitativas no cumplen los supuestos necesarias para su aplicación,
deben utilizarse las pruebas no paramétricas (corresponde como si las
variables de respuesta fuera una variable ordinal)
Los test estadísticos (II)
Prueba de Hipótesis
52
Una prueba de hipótesis es un procedimiento basado en evidencias de las
muestras y la teoría de las probabilidades usadas para determinar la hipótesis. Es
una declaración razonable y no debe ser rechazada, a menos que ésta sea
irrazonable.
Tipo de Hipótesis
Existen dos tipos de estadística:
•Hipótesis Nula Ho: Es la que el investigador trata de refutar.
•Hipótesis Alternativa H1: Es la que el investigador quiere probar.
Nivel de Confianza
estadística 1 − 𝛼. En esta región se encuentran los valores compatibles con la
Es la probabilidad que el intervalo de confianza posea el valor de la variable
acepta 𝐻0.
hipótesis nula. Si el estadístico de prueba o contraste cae en esta zona, se
Los test estadísticos (III)
Nivel de Significancia
53
variable estadística, se le define como 𝛼. En esta región se encuentran los
Es la probabilidad de que el intervalo de confianza no contenga el valor de la
contraste cae en esta zona, se rechaza 𝐻0 y se acepta 𝐻[Link] nivel de
valores incompatibles con la hipótesis nula. Si el estadístico de prueba o
significancia, entonces, puede considerarse también como la probabilidad de
rechazar la hipótesis nula cuando es verdadera.
Tipos de Errores
Al tomar una decision sobre una muestra aleatoria, se pueden cometer 2 errores.
[Link] Tipo-I, que es rechazar H0 siendo verdadera
α=P(Error tipo-I)=(Error tipo-I)
[Link] Tipo-II, que es aceptar H0 siendo falsa
β=P(Error tipo-II)=(Error tipo-II)
Los test estadísticos (IV)
54
Los test estadísticos (V)
55
Cuál distribución usar entre t o Z?
En cuanto a la formulación de hipótesis en relación a la media poblacional, se debe
determinar un valor de prueba ([Link] o [Link]) dependiendo de la distribución si es
normal estandarizada z o t student.
¿De qué depende utilizar z o t?
Si SI se conoce la desviación estándar de la población σ utilizar z.
Si NO se conoce la desviación estándar de la población σ entonces utilizar t.
¿Cómo obtener el valor de prueba z o t?
Los test estadísticos (VI)
56 Fórmula para Z
Fórmula para t
Los test estadísticos (VII)
57 z y t crítico
Se necesitan los valores de [Link] y [Link] respectivamente y dependiendo de la
distribución normal estandarizada o t student .
Se utilizaría la función qnorm() para z y qt() para t-student.
Al ser ambas distribuciones simétricas.
Se requiere el nivel de confianza, es decir, el valor de alfa.
α=(1−confianza)/2; dos colas
α=(1−confianza); una cola
[Link]
Los test estadísticos (VIII)
58
¿Qué es el valor p?
El valor p indica la probabilidad de que se
produzca el resultado observado o un resultado
aún más extremo si la hipótesis nula es cierta.
El valor p se utiliza para decidir si la hipótesis nula
se rechaza o se mantiene (no se rechaza). Si el
valor p es menor que el nivel de significación
definido (a menudo el 5%), se rechaza la hipótesis
nula, de lo contrario no.
Artículo escrito por: M. A. Gómez Villegas
[Link]
59 Tarea 3
Para este ejercicio no hay función de R que haga los cálculos directos
Para el cálculo del p-valor, es: pnorm(estadístico).
Nota: debes calcular el estadístico antes
Muchas gracias