"AÑO DEL BICENTENARIO DEL PERÚ: 200 AÑOS DEINDEPENDENCIA"
UNIVERSIDAD NACIONAL TORIBIORODRÍGUEZ DE
MENDOZA
CURSO: Bioestadística
TAREA: Práctica de correlación y regresión simple y múltiple
DOCENTE: Elito Mendoza Quijano
FACULTAD: Ciencias de la salud
ESCUELA PROFESIONAL: Estomatología
ESTUDIANTE: VERA ALBARRAN, Deymer Jhoseth
1. Las siguientes puntuaciones corresponden a las variables X (Coeficiente intelectual) e
Y (Notas del curso de Bioestadística) de los estudiantes de segundo ciclo de la Facultad
de Ciencias de la Salud, se desea saber si estas variables están correlacionadas;
analizar el supuesto de normalidad y elegir la prueba estadística a utilizar; presentar
en tablas y gráficos.
a) Supuesto de normalidad:
Coeficiente Intelectual:
H0: La distribución de la variable coeficiente intelectual no es normal.
H1: La distribución de la variable coeficiente intelectual es normal.
Notas del curso de bioestadística:
H0: La distribución de la variable notas del curso de bioestadística no es normal.
H1: La distribución de la variable notas del curso de bioestadística es normal.
Interpretación: El nivel de significancia elegido es de 0,05. Por lo que, tanto 0,628 y
0,488 al ser mayores que dicho nivel nos indican que su distribución, tanto en la
variable coeficiente intelectual y en notas del curso de bioestadística, es normal.
De esta manera, se procede a aplicar una prueba estadística de tipo paramétrica.
b) Prueba estadística:
Tras haber determinado la viabilidad de aplicar una prueba paramétrica y del mismo
modo contar con los datos precisos de cada variable aplicamos la prueba que
determina el coeficiente de correlación lineal R de Pearson.
H0: El nivel de coeficiente intelectual no se relaciona con las notas del curso de
bioestadística que obtiene cada estudiante.
H1: El nivel de coeficiente intelectual se relaciona con las notas del curso de
bioestadística que obtiene cada estudiante.
Determinación de la correlación en SPSS:
A continuación, el gráfico de dispersión que demuestra también una correlación lineal
positiva fuerte:
Gráfico de dispersión
12
10
10 9 9
8
8 7 7
6
6
4
4 3
2
2
0
0 20 40 60 80 100 120 140 160
Interpretación: El valor de r nos indica que es igual a 0.833. Siendo así, se acepta la
Hipótesis H1, el nivel de coeficiente intelectual se relaciona con las notas del curso de
bioestadística que obtiene cada estudiante, por presentar una correlación positiva
alta.
2. Se evalúa la frecuencia cardiaca de 12 pacientes hospitalizados en la unidad de cuidados
intensivos de un hospital público, se desea saber si existe una correlación con la
saturación de oxígeno analizar el supuesto de normalidad y definir la prueba estadística
a utilizar presentar en tablas y gráficos.
a) Supuesto de normalidad:
Saturación de oxígeno:
H0: La distribución de la variable saturación de oxígeno no es normal.
H1: La distribución de la variable saturación de oxígeno es normal.
Frecuencia cardiaca:
H0: La distribución de la variable frecuencia cardiaca no es normal.
H1: La distribución de la variable frecuencia cardiaca es normal.
Interpretación: El nivel de significancia elegido es de 0,05. Por lo que, tanto 0,410 y
0,981 al ser mayores que dicho nivel nos indican que su distribución, tanto en la
variable saturación de oxígeno y frecuencia cardiaca, es normal.
De esta manera, se procede a aplicar una prueba estadística de tipo paramétrica.
b) Prueba estadística:
Tras haber determinado la viabilidad de aplicar una prueba paramétrica y del mismo
modo contar con que ambas variables son numéricas aplicamos la prueba que
determina el coeficiente de correlación lineal R de Pearson.
H0: La saturación de oxígeno no se relaciona con la frecuencia cardiaca de cada
individuo.
H1: La saturación de oxígeno se relaciona con la frecuencia cardiaca de cada individuo.
Determinación de la correlación en SPSS:
A continuación, el gráfico de dispersión que demuestra también una correlación lineal
positiva moderada, ya que los puntos están más dispersos y alejados de la recta:
Gráfica de dispersión
120
100
80
60
40
20
0
89 90 91 92 93 94 95 96 97 98 99
El nivel de correlación con 0.589 es moderado, de esta manera al expresar correlación
aceptamos la Hipótesis H1: La saturación de oxígeno se relaciona con la frecuencia
cardiaca de cada individuo, no obstante, esto solo en un nivel moderado.
3. En un estudio se desea saber si la hemoglobina y la glucosa, están correlacionados con
el peso de los pacientes hospitalizados en el HRVF, Analizar el supuesto de normalidad
y elegir la prueba estadística a utilizar
a) Supuesto de normalidad:
Hemoglobina de los pacientes hospitalizados en el HRVF:
H0: La distribución de la variable hemoglobina no es normal.
H1: La distribución de la variable hemoglobina es normal.
Glucosa de los pacientes hospitalizados en el HRVF:
H0: La distribución de la variable glucosa no es normal.
H1: La distribución de la variable glucosa es normal.
Edad de los pacientes hospitalizados en el HRVF:
H0: La distribución de la variable edad no es normal.
H1: La distribución de la variable edad es normal.
Según la prueba de normalidad de Shapiro Wilk las tres variables son normales al ser
mayores que 0,05 con su nivel de significancia 0.553, 0.760 y 0.606 en las variables
peso, hemoglobina y glucosa respectivamente.
Prueba estadística
Correlations
peso hemoglobina glucosa
peso Pearson Correlation 1 -,122 -,170
Sig. (2-tailed) ,705 ,597
N 12 12 12
hemoglobina Pearson Correlation -,122 1 ,155
Sig. (2-tailed) ,705 ,631
N 12 12 12
glucosa Pearson Correlation -,170 ,155 1
Sig. (2-tailed) ,597 ,631
N 12 12 12
4. Se realiza un estudio para establecer una ecuación mediante la cual se pueda utilizar
la concentración de estrona en saliva (X) para predecir la concentración del esteroide
en plasma libre (Y). Se extrajeron los siguientes datos de 14 varones sanos
Entonces, procesamos los datos en SPSS:
Evaluamos si las variables son normales:
Observamos en las gráficas que la ubicación de los puntos, se aproximan a la diagonal.
Por lo que se confirma la Hipótesis de normalidad. Asimismo, la tabla nos indica los
valores de normalidad de 0.993 (concentración de estroma) y 0.563 (concentración de
esteroide) los mismos que resultan mayores al nivel de significancia trabajado de 0.05.
Entonces, al ser variable bidimensional procedemos a aplicar una prueba de correlación
paramé[Link] este caso R de Pearson:
La correlación obtenida es positiva fuerte con 0.914 por lo que el modelo a determinar
presentará un grado de ajuste alto.
Determinación del modelo:
La determinación de los coeficientes nos va a permitir establecer la ecuación siguiendo
el modelo:
y=b0+b1X
y = 15.853+2.263X
Lo comprobamos usando Excel y nos muestra el mismo resultado junto con el R2.
Gráfico de dispersión y = 2.2626x + 15.853
R² = 0.8356
80
70
60
50
40
30
20
10
0
0 5 10 15 20 25
De la ecuación podemos interpretar que la concentración del esteroide en plasma libre
va ser igual a 15,853 más 2,63 multiplicado por la concentración de estrona en saliva.
Por otro lado, del R2 pasándolo a porcentaje, nos dice que el estroma en saliva va a
formar el 83.56% del esteroide en plasma libre.
el 83.56% de la concentración de esteroide en plasma libre, va a estar compuesto por
estroma en saliva.
5. Se ha medido el aclaramiento de creatinina en pacientes tratados con Captopril tras
la suspensión del tratamiento con diálisis, resultando la siguiente tabla:
a) Hállese la expresión de la ecuación lineal que mejor expresé la variación de la
creatinina, en función de los días transcurridos tras la diálisis, así como el grado
de bondad de ajuste llamado coeficiente de determinación, presente en tablas y
gráficos
Primero determinamos los coeficientes siguiendo el modelo:
y=b0+b1X
y = -0.0552x + 5.475
Diagrama de dispersión R² = 0.921
6
0
0 5 10 15 20 25 30 35 40
Expresión de ecuación lineal: y = 5.475-0.0552x
Interpretación:
Con respecto al gráfico de dispersión decimos que hay una relación negativa fuerte,
debido a la forma de distribución de los puntos.
En cuanto a la ecuación lineal, el nivel de creatinina en pacientes tratados con
Captopril tras la suspensión del tratamiento con diálisis va a ser igual a la constante
b0(5.475) menos el producto de b1 (0.0552) por los días transcurridos tras la diálisis.
Referente al nivel de bondad o coeficiente de determinación. El 92.1% del
aclaramiento de creatinina en los pacientes va a verse influenciado por la cantidad de
días tras la diálisis. Por lo que, el 92.1% de la variabilidad del aclaramiento de la
creatinina es explicado por el modelo determinado, manteniendo un alto grado de
ajuste.
b) Si un individuo presenta 401 mg/dl de creatinina, ¿cuánto tiempo es de esperar que
haya transcurrido desde la suspensión de la diálisis?
Remplazamos en el modelo anteriormente obtenido:
y=5.475-0.0552x
401 = 5.475 − 0.0552𝑥
−7165.30797 = 𝑥
Redondeando y expresando en positivo debido a que los días no pueden ser negativos
x=7165 días.
Interpretación: Al ser un modelo con relación negativa fuerte (demostrado en el
gráfico) para tener 401 mg/dl de creatinina tienen que haber transcurrido 7165 días.
6. Se intenta estudiar la correlación existente entre el número de años de estudio, las
horas de estudio al día y el número de premios obtenidos durante su vida profesional
aplicar el coeficiente de correlación y si es conveniente realice una regresión lineal
múltiple y elabore un modelo predictivo
Variables a evaluar:
Número de años de estudio (Independiente)
Horas de estudio al día (Independiente)
Número de premios obtenidos durante su vida profesional (Dependiente)
Determinación de la correlación:
H0: No existe correlación lineal múltiple entre el número de años de estudio y las
horas de estudio al día con el número de premios obtenidos durante la vida
profesional de un individuo.
H1: Existe correlación lineal múltiple entre el número de años de estudio y las horas de
estudio al día con el número de premios obtenidos durante la vida profesional de un
individuo
ANOVAa
Model Sum of df Mean Square F Sig.
Squares
1 Regression 30,059 2 15,029 19,693 ,004b
Residual 3,816 5 ,763
Total 33,875 7
a. Dependent Variable: Premios_obtenidos
b. Predictors: (Constant), Horas_de_estudio_al_día, Años_de_estudio
Valor P=Sig=0.000<α=0,05
Aceptamos la H1 donde existe correlación lineal múltiple entre el número de años de
estudio y las horas de estudio al día con el número de premios obtenidos durante la
vida profesional de un individuo.
Regresión y determinación del modelo:
Coefficientsa
Model Unstandardized Coefficients Standardized t Sig.
Coefficients
B Std. Error Beta
1 (Constant) 3,146 1,470 2,140 ,085
Años_de_estudio -,029 ,105 -,047 -,275 ,794
Horas_de_estudio_al_día ,775 ,145 ,918 5,327 ,003
a. Dependent Variable: Premios_obtenidos
𝐲 = 𝟑. 𝟏𝟒𝟔 − 𝟎. 𝟎𝟐𝟗𝒙𝟏 + 𝟎. 𝟕𝟕𝟓𝒙𝟐
Interpretación: El número de premios obtenidos y su relación con los años de estudio
y las horas de estudio va ser: número de premios obtenidos es igual a la constante
(3,146) menos 0.029 multiplicado por los años de estudio y luego sumado con el
producto de 0.775 y la cantidad de horas de estudio.
7. Se estudia Y = la tasa de respiración (moles O 2 /([Link])) del liquen Parmelia saxatilis
bajo puntos de goteo con un recubrimiento galvanizado. El agua que cae sobre el
liquen contiene zinc y potasio, que utilizamos como variables explicativas, construir
un modelo predictivo.
Identificación de variables:
Tasa de respiración (Dependiente)
Potasio (Independiente)
Zinc (Independiente)
Construcción del modelo a través de regresión lineal múltiple en SPSS:
Identificación de coeficientes:
Coefficientsa
Unstandardized Standardized 95.0% Confidence Interval for
Coefficients Coefficients B
Model B Std. Error Beta t Sig. Lower Bound Upper Bound
1 (Constant) 101,088 18,866 5,358 ,002 54,925 147,252
Potasio -,040 ,034 -,373 -1,178 ,283 -,124 ,043
Zinc -,004 ,001 -1,225 -3,867 ,008 -,006 -,001
a. Dependent Variable: Tasa_de_respiración
Elaboración del modelo:
𝐲 = 𝟏𝟎𝟏. 𝟎𝟖𝟖 − 𝟎. 𝟎𝟒𝟎𝒙𝟏 + 𝟎. 𝟎𝟎𝟒𝒙𝟐
Interpretación:
La relación entre tasa de respiración y el riego con potasio y zinc se determina con el modelo
donde: la tasa de respiración (y) es igual a la constante 101.088, menos el producto de 0.040
con los niveles de potasio en el riego, más el producto de 0.004 con los niveles de Zinc en el
riego.
8. El gerente de una empresa de instrumental quirúrgico, estudia las predicciones entre
beneficios anuales, gasto en publicidad anual y horas extraordinarias anuales de los
empleados. Para ello utiliza datos de estas 3 variables, proporcionadas por algunas
empresas del sector, analice el supuesto de normalidad y el supuesto de
independencia y realice una regresión lineal múltiple.
Supuesto de normalidad:
Beneficios anuales:
H0: La distribución de la variable beneficios anuales no es normal.
H1: La distribución de la variable beneficios anuales es normal.
Gastos en publicidad:
H0: La distribución de la variable gastos en publicidad no es normal.
H1: La distribución de la variable gastos en publicidad es normal.
Horas extras:
H0: La distribución de la variable horas extras no es normal.
H1: La distribución de la variable horas extras es normal.
Tests of Normality
Kolmogorov-Smirnova Shapiro-Wilk
Statistic df Sig. Statistic df Sig.
Beneficios_millones ,231 7 ,200* ,871 7 ,191
GastosPublicidad_millones ,165 7 ,200* ,943 7 ,665
*
HorasExtras_100horas ,197 7 ,200 ,920 7 ,471
*. This is a lower bound of the true significance.
a. Lilliefors Significance Correction
En las tres variables p es mayor al nivel de significancia 0.005. Aceptamos, que la distribución de
las variables es normales.
Supuesto de independencia:
Regresión lineal múltiple:
Coefficientsa
Standardize
Unstandardized d 95.0% Confidence Interval
Coefficients Coefficients for B
Lower Upper
Model B Std. Error Beta t Sig. Bound Bound
1 (Constant) ,590 ,641 ,920 ,410 -1,190 2,369
GastosPublicidad_mill ,936 ,311 ,670 3,007 ,040 ,072 1,800
ones
HorasExtras_100hora ,187 ,120 ,346 1,553 ,195 -,147 ,520
s
a. Dependent Variable: Beneficios_millones
𝐲 = 𝟎. 𝟓𝟗𝟎 − 𝟎. 𝟗𝟑𝟔𝒙𝟏 + 𝟎. 𝟏𝟖𝟕𝒙𝟐
Los beneficios anuales medidos en millones (y) van a ser igual a 0.590 menos el producto de
0.936 con los gastos en publicidad, más el producto de 0.187 con las horas extraordinarias
anuales de los empleados.
9. Se desea estimar la eficiencia de los trabajadores de la salud para ello se ha medido
su ratio de puntualidad y su ratio de habilidad manual. Encontrar un modelo
predictivo que permita estimar la eficiencia, si se conoce de antemano su puntualidad
y su habilidad.
Identificación de variables:
Eficiencia de los trabajadores (Dependiente)
Puntualidad de los trabajadores (Independiente)
Habilidad manual de los trabajadores (Independiente)
Determinación del modelo:
Coefficientsa
Standardized
Unstandardized Coefficients Coefficients
Model B Std. Error Beta t Sig.
1 (Constant) -96,801 11,630 -8,323 ,000
Puntualidad 2,850 ,350 ,562 8,132 ,000
Habilidad 1,108 ,113 ,676 9,779 ,000
a. Dependent Variable: Eficiencia
𝐲 = −𝟗𝟔. 𝟖𝟎𝟏 + 𝟐. 𝟖𝟓𝟎𝒙𝟏 + 𝟏. 𝟏𝟎𝟖𝒙𝟐
Model Summaryb
Std. Error of the
Model R R Square Adjusted R Square Estimate
1 ,989a ,978 ,969 3,4328
a. Predictors: (Constant), Habilidad, Puntualidad
b. Dependent Variable: Eficiencia
El modelo nos indica que la eficiencia de los trabajadores va ser igual al intercepto (-96.801),
más el producto de 2.850 por la puntualidad, más el producto de 1.108 por la habilidad manual
de los trabajadores.