0% encontró este documento útil (0 votos)
3 vistas29 páginas

Tutorial RCMDR

El documento es un tutorial sobre el uso de R Commander, una interfaz gráfica para el análisis estadístico en R, que facilita la importación de datos, análisis y creación de gráficos sin necesidad de programación. Se abordan temas como la instalación, importación de datos desde Excel, análisis de variables cuantitativas y cualitativas, y la realización de pruebas estadísticas. Además, se incluyen instrucciones para crear nuevas variables y realizar gráficos, así como ejemplos prácticos de uso.

Cargado por

Nicol Rivoira
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas29 páginas

Tutorial RCMDR

El documento es un tutorial sobre el uso de R Commander, una interfaz gráfica para el análisis estadístico en R, que facilita la importación de datos, análisis y creación de gráficos sin necesidad de programación. Se abordan temas como la instalación, importación de datos desde Excel, análisis de variables cuantitativas y cualitativas, y la realización de pruebas estadísticas. Además, se incluyen instrucciones para crear nuevas variables y realizar gráficos, así como ejemplos prácticos de uso.

Cargado por

Nicol Rivoira
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Facultad de Bioquímica y Ciencias Biológicas

Departamento de Matemática y Estadística

Tutorial para uso de R Commander

Contenido
Tutorial: R, R-Commander............................................................................................................. 2
R-RCommander: ........................................................................................................................ 2
Instalación. ................................................................................................................................ 2
Importar datos a R, R-Commander. .............................................................................................. 3
Desde el Portapapeles............................................................................................................... 4
Formato de archivo xlsx (Excel). ................................................................................................ 5
Análisis de los Datos. ..................................................................................................................... 5
Modificando nuestros datos. .................................................................................................... 6
Resumen para variables cuantitativas. ......................................................................................... 7
Resumen para variables cualitativas. ............................................................................................ 8
Gráficos. ........................................................................................................................................ 9
Histograma. ............................................................................................................................... 9
Box-Plot. .................................................................................................................................. 10
Gráficos de barra. .................................................................................................................... 11
Univariante: ..................................................................................................................... 11
Bivariantes: ...................................................................................................................... 11
Filtrado de datos. ........................................................................................................................ 12
Creación de una nueva variable. ................................................................................................. 12
Test de Independencia o Chi cuadrado. ...................................................................................... 14
Test de proporciones para una muestra. .................................................................................... 15
Test para muestras independientes............................................................................................ 16
Test t para una muestra. ......................................................................................................... 16
Test t para dos muestras. ........................................................................................................ 17
Test t para muestras dependientes. ........................................................................................... 19
ANOVA de un factor. ................................................................................................................... 21
Regresión Lineal simple ............................................................................................................... 25
Guardado de conjunto de datos activo ....................................................................................... 29
Guardar instrucciones y resultados............................................................................................. 29

Página 1
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Tutorial: R, R-Commander
R-RCommander:
R es un entorno y lenguaje de programación especializado en el análisis estadístico, la
visualización de datos y la ciencia de datos muy difundido y utilizado tanto en el mundo
académico como empresarial.

R Commander es una interfaz gráfica diseñada para facilitar el uso de R a personas que pueden
no estar familiarizadas con la programación en R o que prefieren trabajar con un entorno más
visual y amigable. R Commander permite a los usuarios realizar análisis estadísticos y gráficos
prácticamente sin necesidad de escribir código.

R Commander no es más que un paquete o complemento que se instala en R y nos brinda una
interfaz con la cual interactuar.

Instalación.
En el siguiente link pueden descargar el programa. ([Link]

Recuerde que luego de instalarlo probablemente no cree un icono en el escritorio por lo que
usted deberá ingresar al menú inicio y buscar donde se ha instalado el programa. Puede usar la
opción “Buscar” de Windows para ello.

Lego de instalarlo, ejecute el programa, al hacerlo, el paquete se cargará automáticamente y


podrá visualizar la ventana del R-Commander
Menú Interactivo

R Script: Comandos generados automaticamente


por R commander

Salida: Salida o Resultados

Mensajes

Página 2
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Con esta interfaz la realización de las actividades se vuelve más intuitiva, como pueden observar
la pantalla cuenta con 4 secciones.

• Menú Interactivo: Aquí podrá acceder a las distintas opciones para poder realizar los
comandos que luego serán volcados en la siguiente sección.
• R Script: Aquí aparecerán escritos (en lenguaje R) los comandos que hallamos
seleccionados para luego ser ejecutados, si no fuera por la utilización de R Commander
usted tendría que escribir estos comandos (código) uno por uno.
• Salida: Como su nombre lo indica aquí es donde encontramos los resultados de los
comandos que hayamos ejecutados.
• Mensajes: Si hubiese algún tipo de error nos será informado en la zona de mensajes,
generalmente de color rojo.

Para realizar este tutorial utilizaremos una base de datos (base_tutorial.xls) que fue creada para
este fin y se encuentra disponible en el aula virtual de la asignatura.

Esta base de datos será nuestro punto de partida para comenzar a recorrer las distintas
funciones del programa que utilizaremos.

En este punto es importante notar que en muchas ocasiones las bases de datos son generadas
en primer lugar en planillas de cálculo y luego importadas por los programas estadísticos para
su análisis.

Se muestra a continuación una captura de la base de datos que utilizaremos, la misma se


encuentra en formato planilla de cálculo (.xls).

Como se puede observar, en las columnas se organizan las variables y en las filas los casos
observados.

Lo primero que debemos hacer es chequear la integridad de los datos, que no haya habido algún
error en la descarga del archivo y la ausencia de datos o errores en la carga de los mismos.
Si observamos los datos, podemos apreciar que la base posee 4 columnas (variables), y 731
registros (esto último no se observa en la captura). A primera vista parecería todo correcto.

Importar datos a R, R-Commander.


Vamos a ver dos formas de importar nuestros datos a R.

Página 3
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Desde el Portapapeles
Con este método simplemente seleccionamos las columnas en Excel y copiamos nuestra
selección al portapapeles de nuestro dispositivo.

CRTL+C
Seleccionamos las 4 columnas y las
copiamos la selección al portapapeles

En la pantalla, de R-Commander nos dirigimos al menú Datos/Importar Datos y elegimos la


opción desde archivo de texto, portapapeles o URL…

En esta nueva ventana debemos,


elegir las opciones correctas para
pegar los datos desde el Excel.

Le podemos dar un nombre a


nuestro conjunto de Datos, que sea
representativo para luego trabajar.

Luego, al hacer clic sobre el botón Aceptar, podremos ver en la sección “Conjunto de datos:”
nuestra base cargada.

Los datos fueron cargados correctamente y


nuestro nuevo conjunto de datos se llama
base_tutorial y lo visualizaremos de color AZUL.
Al hacer clic en ese comando se podrán visualizar
todos los conjuntos de datos activos.

Página 4
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Podemos ver también en la sección de mensajes del R-Commander si ha aparecido algún
mensaje de error.

Como se puede observar, no hay ningún mensaje de error (aparecen en color rojo), a su vez nos
informa que ha importado 731 filas y 4 columnas, tal como teníamos en nuestra planilla.

Formato de archivo xlsx (Excel).

R tiene la capacidad de leer archivos que pertenecen a la suite de Office de Microsoft, para ello
simplemente seleccionamos la opción.

Si el libro posee más de una hoja nos


permite seleccionar en que hoja se
encuentran nuestros datos
Nuevamente podemos ver si ha habido algún error chequeando la sección de mensajes.

Análisis de los Datos.


Comencemos analizando las variables de nuestra base de datos, para ellos debemos ir al menú
Estadísticos/Resúmenes/Conjunto de Dato Activo

Página 5
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Y el programa nos devolverá un resumen de todas las variables, los resultados se visualizarán en
la sección “salidas”:

R al importar los datos analiza cada columna (variable) y asume que si todos los valores son
números es por lo tanto una variable numérica, como sucede en nuestro caso con las variables,
peso (medido en Kg), altura (medida en cm). R nos entrega un resumen que nos informa el valor
mínimo, máximo, la mediana, la media y 1º y 3º cuartil.
Contrariamente si lo que detecta es una cadena de caracteres, asume que es una variable
cualitativa, en nuestro caso las variables sexo y Carrera, aquí nos informa la frecuencia de cada
categoría de la variable (en R a las variables cualitativas se les denomina factores y a cada
categoría se la denomina nivel).

Modificando nuestros datos.


En algunos casos puede ocurrir que tengamos una variable categórica, sexo, por ejemplo, que
fue codificada en forma numérica, digamos como 0 y 1. Esto es una práctica muy habitual en la
carga de datos. En este caso el 0 hace referencia a la categoría “hombres” y el 1 a “mujeres”.
Por lo tanto, como en este caso la variable está escrita en forma numérica debemos indicarle a
R que lo cambie y asuma que es una variable cualitativa.

Como ejemplo se muestra un pequeño conjunto de datos distinto al que estamos trabajando.

Página 6
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Si quisiéramos resumir la variable


sexo tal cual está definida en nuestra
base obtendríamos un resultado que
no nos sería de mucha utilidad.

Para redefinir nuestra variable, vamos al menú:


Datos/Modificar variables del conjunto de datos activos/Convertir variable numérica en
factor

Si no sobreescribimos
nuestra variable la
R nos preguntará que renombramos.
nombre queremos
asignarle a cada nivel
de nuestro factor.

Luego podemos verificar que nuestros arreglos hayan sido los correctos, para ello podemos
realizar nuevamente un análisis de nuestros datos

Resumen para variables cuantitativas.


Anteriormente vimos que al ejecutar dentro del menú resúmenes el comando conjunto de
datos activos, R nos mostraba un resumen de todas las variables de nuestra base de datos.

Si por el contrario estamos interesados en analizar alguna variable en particular tenemos


comandos específicos para cada tipo de variables.

Página 7
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Aquí podemos elegir


qué información
necesitamos visualizar

Salida:

También podemos resumir nuestro conjunto de datos de acuerdo a alguna de nuestras


variables cualitativas. En el siguiente ejemplo resumiremos la variable altura segmentado por
sexo.
Seleccionamos la variable

Elegimos la variable
cualitativa por la cual
queremos dividir nuestro
análisis

Salida
Sexo del
individuo

Resumen para variables cualitativas.

Página 8
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Frequencia absoluta

Frequencia relativa

Gráficos.
Procedamos ahora a realizar algunos gráficos. El menú gráfico que encontramos en R-
Commander es muy intuitivo.

Para variables cualitativas

Histograma.

Página 9
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

En una nueva ventana R nos


mostrará el histograma de la
variable altura, separado por
sexo.

Box-Plot.
Veamos cómo podemos realizar un Diagrama de Caja o Box-Plot, accedemos al menú Gráficas y
simplemente elegimos una variable del cuadro y aceptamos, en este caso graficamos altura:

Del mismo modo que con el histograma también es posible realizar gráficos de caja separados
por grupos. A continuación, graficaremos la altura separada por sexo

Página 10
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Gráficos de barra.
Univariante:

Frecuencia absoluta
Frecuencia relativa %

Bivariantes:
También podemos graficar variables por grupos (agrupadas).

Página 11
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Filtrado de datos.
Esta herramienta permite seleccionar, dentro de un conjunto de datos activos, un subconjunto
de datos respecto a uno o más criterios de selección.

En el siguiente ejemplo aplicaremos un filtro a la variable “sexo” solicitando que excluya de esta
variable los casos que correspondan a “H”, es decir, los hombres.

Para hacer vamos al menú Datos/Conjunto de datos activo y elegimos la opción Filtrar el
conjunto de datos activo

Criterio de
Filtrado.

Luego de aplicar el filtro R Aquí le asignamos un nombre


genera un nuevo conjunto al nuevo conjunto de datos, si
de datos no lo hacemos R sobrescribirá
los datos activos.

Si quisiéramos aplicar un doble filtro, por ejemplo, los “H”


en la variable sexo y “Biotecnología” en la variable
Carrera. En la caja de texto para Expresión de selección y
luego de seleccionar las variables sobre las cuales
aplicaremos el filtro escribiríamos el siguiente código:

sexo=="H" & Carrera=="Biotecnología"

peso<80, en este caso aplicaremos un filtro sobre la


variable “peso” y crearemos un subconjunto de datos
para aquellos individuos cuyos pesos sean menores que 80 Kg.

Creación de una nueva variable.


Ahora vamos a crear dos nuevas variables.

La primera de ellas es calcular la altura del individuo en metros, para hacer esto nos vamos al
menú: Datos/Modificar variables del conjunto de datos activo y elegimos la opción Calcular
una nueva variable

Página 12
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Le asignamos un Expresión para su


nombre a nuestra cálculo
Para verificar que este paso fue realizado nueva variable
correctamente podemos ver la sección de mensajes o visualizar nuestro conjunto de datos
activos.

Como podemos observar, nuestro nuevo conjunto de datos ahora tiene 5 columnas.

La segunda variable que calcularemos es el índice de masa corporal (IMC) el cual surge de
dividir el peso del individuo por su altura (en metros) elevada al cuadrado.
IMC= peso/(altura_m)^2
Para realizar esto vamos al mismo menú que utilizamos para el cálculo de la primera variable,
pero en este caso escribiremos la siguiente expresión:

Para seguir practicando este comando podemos calcular una tercera variable, en este caso
categórica.
A esta nueva variable le asignaremos el nombre “condición” y la calcularemos a partir del IMC.
Para ello utilizaremos una prueba lógica realizada a través de la función “ifelse”
ifelse(imc>30,”sobrepeso”,”normo o bajo peso”)

La expresión anterior se puede leer como: si imc es mayor a 30, sobrepeso, caso contrario
normo o bajo peso. Tener en cuenta que esta categorización puede carecer de sentido clínico,
pero nos resulta muy útil a los efectos prácticos.

Nuevamente, para verificar la


correcta creación de nuestra variable
verificamos la sección de mensajes
y/o nuestro conjunto de datos
activos.

Página 13
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Test de Independencia o Chi cuadrado.


En este caso vamos a contrastar, la variable sexo y condición. Estamos interesados en saber si
existe algún tipo de asociación entre estas dos variables, para ello:

Veamos la salida del Test.

Tabla 2x2

Valor del estadístico X2 y su valor p


asociado.

Podríamos cambiar como se muestra la variable sexo recodificándola para poder observarla
como hombre y mujer

Escribimos el nuevo
código de nuestra
variable

Ahora podemos realizar nuevamente el test pero con nuestra variable recodificada

Página 14
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Si contamos con los datos ya resumidos podemos cargar los resultados directamente en la tabla
de contingencia y realizar el test chi cuadrado

Claramente obtenemos el mismo resultado,


pero en este caso realizamos la carga
manual de nuestra tabla de contingencia.

Test de proporciones para una muestra.


En este contraste de hipótesis analizaremos si la proporción poblacional de mujeres en nuestra
muestra aleatoria puede considerarse diferente de 0,5

Proporción muestral a
contrastar

Proporción poblacional

Resultado del test Recuento de casos.


*Importante: ver orden de
las categorías

Valor p asociado.

Intervalo de confianza

Proporción muestral (mujeres)

Página 15
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
*Siempre es necesario chequear que la primera categoría sea la que estamos interesados en
contrastar, R asigna orden a las categorías en forma alfabética. En este caso hombre sería la
proporción muestral que R contrastaría por defecto a menos que le cambiemos el orden.

Para hacer esto seguiremos la siguiente secuencia:

Le reasignamos el orden.

Test para muestras independientes.


Test t para una muestra.
El test t para una muestra se utiliza para determinar si la media muestral difiere
significativamente de un valor específico, comúnmente obtenido de la bibliografía o de algún
criterio establecido por el investigador.
En nuestro ejemplo analizaremos la variable IMC y la contrastaremos contra un valor arbitrario
establecido en 30.
Para ello seguiremos la siguiente secuencia de pasos:

Página 16
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Resultados del test

Valor de estadístico t
observado.
Valor p asociado

IC 95%

Media muestral

Test t para dos muestras.


Para este ejemplo estamos interesados en determinar si existen evidencia para considerar que
el IMC de los hombres difiere significativamente del de las mujeres.

Para realizar esto, seguiremos la siguiente secuencia de pasos:

Resultados del test

Valor p asociado

IC 95%

Medias muestrales de cada


grupo

Verificación de supuestos

Página 17
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Independencia: garantizada en el muestreo, en nuestro caso, se realizó un muestreo aleatorio
de una población de alumnos que asisten a una universidad pública.

Normalidad: las poblaciones de las cuales se extraen las muestras deben seguir una
distribución normal. Este supuesto es muy importante para muestras pequeñas (n<30), que no
es el de nuestro caso. Para muestras grandes, el test t es bastante robusto a desviaciones de la
normalidad (Teorema del Límite Central). Para verificar este supuesto utilizaremos el test de
Shapiro-Wilk donde:

Hipótesis nula (H₀): Los datos provienen de una distribución normal.


Hipótesis alternativa (H₁): Los datos no provienen de una distribución normal.

Homogeneidad de varianzas: Las varianzas de las dos poblaciones deben ser iguales. Esto se
puede verificar con la prueba de Levene o la prueba de F. Si las varianzas no son iguales, se
debe utilizar una versión del test t que no asuma igualdad de varianzas (test t de Welch). En
nuestro caso utilizaremos el test de Levene donde:

Hipótesis nula (H₀): Las varianzas de los grupos son iguales.


Hipótesis alternativa (H₁): Al menos una de las varianzas de los grupos es diferente.

Test de Shapiro-Wilk

Para realizar este test seguiremos la siguiente secuencia de pasos:

Resultados del test:

Grupo

Valor p asociado a la prueba

Página 18
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Test de Levene:

Resultado del Test

Como
resultado del test de Levene, no podemos asumir varianzas iguales y por lo tanto debemos
recalcular nuestro test t teniendo en cuenta esta condición. En este caso se aplica la corrección
de Welch. Resultado del Test

Test t para muestras dependientes.


El test t para muestras dependientes (o test t para muestras apareadas) se utiliza para comparar
las medias de dos grupos relacionados. Esto se aplica, por ejemplo, en estudios antes y después
sobre los mismos sujetos o en situaciones donde las observaciones están emparejadas de alguna
manera.
Para poder realizar este test en nuestro conjunto de datos vamos generar una nueva variable
llamada peso_despues. Para intentar poner en contexto nuestro análisis podemos asumir que
los pesos registrados en nuestros individuos corresponden a los pesos iniciales, es decir, previos
a un tratamiento como podría ser una dieta. Como son datos simulados, le vamos a pedir a R
que nos genere una variable con distribución normal, 731 datos (que es el número de casos de
nuestro conjunto de datos), con media 60 y desviación estándar 10.
El menú interactivo de r Commander no nos puede ayudar para resolver esto y por lo tanto
tendremos que hacerlo introduciendo el siguiente código:
peso_despues <- rnorm(731, mean = 60, sd = 10)

Página 19
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Luego podemos verificar que los datos fueron generados:
View(peso_despues)
Finalmente, agregamos el conjunto de datos generado previamente a la base de trabajo
(base_tutorial).
peso_despues-> base_tutorial$peso_despues
Podemos verificar la correcta incorporación de nuestra nueva variable visualizando el conjunto
de datos activos.
Veamos el paso a paso:
En R Script escribimos la primera parte del código:

Seleccionamos el
código y hacemos clic
en Ejecutar

Luego de Ejecutar el código


nos muestra una ventana
emergente con los datos
generados

Luego de ejecutar el
código podemos ver la
nueva columna en la
opción “Visualizar
Conjunto de datos”

Luego de hacer esto debemos pedirle a R que actualice la base de datos. Para ello seguimos la
siguiente secuencia:

Página 20
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Ahora si vamos a realizar el test t para muestras dependientes

ANOVA de un factor.
El ANOVA con un factor o modelo factorial de un solo factor es el tipo de análisis que se emplea
cuando se quiere estudiar si existen diferencias significativas entre las medias de una variable
aleatoria continua en los diferentes niveles de otra variable cualitativa o factor.

Para nuestro ejemplo estaremos interesados en determinar si existen diferencias significativas


entre el peso de los individuos de nuestra muestra y la carrera a la cual pertenecen.

En primer lugar realizaremos un análisis exploratorio:

Para mejorar la calidad visual de nuestros gráficos vamos a cargar un paquete específico para la
generación de gráficos de alta calidad llamado ggplot2.

Para ello seguiremos la siguiente secuencia de pasos:

Página 21
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Al cargar el plugin nos advierte que R se reiniciará

Luego de reiniciar el programa ya podemos ver nuestra nueva herramienta integrada en la barra
de menú

Análisis exploratorio:

Página 22
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
ANOVA

Veamos la salida del análisis:

El análisis muestra que


no existen diferencias
estadísticamente
significativas entre las
medias del IMC y las
carreras
Comparaciones de a pares

Gráfico de las comparaciones

Evaluación de los supuestos del modelo


Utilizaremos para ello la muestra de residuos

Página 23
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Para recuperar los valores residuales del análisis tenemos que incorporarlos a nuestros datos,
para realizar esto seguiremos la siguiente secuencia de pasos:

Aquí podemos seleccionar qué valores


necesitamos cargar para nuestra
evaluación

Luego podemos verificar este paso visualizando nuestro conjunto de datos y/o en la sección de
mensajes y observar el incremento en la cantidad de columnas en nuestra base.

Normalidad de los residuos

Q-Q Plot

Para realizar este gráfico seguimos la siguiente secuencia de pasos

Menú Gráficas/Gráficas de comparación de cuantiles / Pestaña datos: residuals.(nombre que


signamos a nuestro modelo) / Pestaña opciones: seleccionamos Normal

Este gráfico se puede visualizar a partir del


menú: Modelos / Gráficas / Gráficas basicas
de diagnóstico

Test de Shapiro – Wilk


Estadísticos / Resúmenes / Test de Normalidad / residuals / Shapiro-Wilk

Homogeneidad de varianzas

Gráfico de dispersión xy entre los residuos (residuals) y los valores predichos (fitted)

Página 24
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Este gráfico también se puede visualizar a


partir del menú: Modelos / Gráficas /
Gráficas básicas de diagnóstico

Test de Levene
Secuencia de pasos:
Estadísticos / Varianzas / Test de Levene / Factores: Carrera / Variable explicada: residuals /
Centro: Mediana

Regresión Lineal simple


Para realizar este ejemplo vamos a cargar una base de datos que se encuentra disponible online.
Los datos corresponden a tres variables medidas en 25 individuos: edad, peso y cantidad de
grasas en sangre. Para leer los datos y cargarlos en R vamos a pegar y ejecutar en la sección R
Script el siguiente código:

file <- "[Link]


datos_RLS <- [Link](file=file, header=TRUE)
head(datos_RLS)
editDataset(datos_RLS)

Si todo funcionó correctamente debería observar lo siguiente:

Página 25
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Para poder observar las posibles relaciones entre cada par de variables podemos realizar una
matriz de diagramas de dispersión.

Para ello nos vamos al menú: Gráficas / Matriz de diagramas de dispersión…

Seleccionamos las 3
variables de nuestra
base

Al analizar la matriz podemos observar que resulta razonable suponer una relación lineal entre
las variables edad y contenido de grasas

Podemos utilizar el complemento ggplot2 (KMggplot2) para mejorar el aspecto visual de


nuestro gráfico e incorporarle, por ejemplo, líneas de suavizado con intervalos de confianza.

Página 26
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Regresión lineal

Para realizar el análisis de regresión nos vamos a: Menú: Estadísticos / Ajuste de modelos /
Regresión Lineal

Veamos la salida:

Por lo tanto la línea recta que mejor explica la relación entre el contenido de grasas y la edad
está dada por:
Grasas= 5.32*edad + 102.57

Página 27
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística
Podemos agregar la recta de mínimos cuadrados a la nube de puntos

Verificación de las Hipótesis del modelo (supuestos que deben cumplirse)


Verificaremos esto sobre la muestra de residuos.
Normalidad:

En el menú: Modelos / Gráficas / Graficas Básicas de diagnóstico podremos obtener las


distintas opciones gráficas para la verificación de los supuestos de nuestro modelo.

Homocedasticidad de los errores

Página 28
Facultad de Bioquímica y Ciencias Biológicas
Departamento de Matemática y Estadística

Guardado de conjunto de datos activo


Para guardar el conjunto de datos activo debemos seguir la siguiente secuencia de pasos.

Luego, para recuperar el conjunto de datos guardados vamos a Datos / Cargar Conjunto de
datos -> seleccionamos el directorio donde se encuentran ubicados

Guardar instrucciones y resultados


Cuando se cierra una sesión de R Commander se nos pregunta por las opciones de:

- Guardar el archivo de instrucciones (que se guardará con extensión .R). Luego se podrá
recuperar y ejecutarlo nuevamente.

- Guardar el archivo de salida o de resultados (que se guardará con extensión .txt)

En cualquier momento también se pueden guardar dichos ficheros desde el menú “Fichero”

Página 29

También podría gustarte