# 1.
Cargar la base de datos
> #Instalar paquetes necesarios (si aun ni los tienes)
> [Link](c("readxl", "psych", "ggplot2", "car"))
Error in [Link] : Updating loaded packages
# Cargar las bibliotecas
> library(readxl)
> library(psych)
> library(ggplot2)
> library(car)
#cargar la base de datos
> file_path <-"D:/analisis_datos_cuantitativos_nuevo.xlsx"
> data <-read_excel(file_path)
#Verificar la estructura de los datos
> str(data)
tibble [50 × 8] (S3: tbl_df/tbl/[Link])
$ ID_Empleado : num [1:50] 1 2 3 4 5 6 7 8 9 10 ...
$ Satisfaccion_Laboral : num [1:50] 7.75 6.79 7.97 9.28 6.65 6.65 9.37 8.15
6.3 7.81 ...
$ Horas_Trabajo_Semanal : num [1:50] 41.6 38.1 36.6 43.1 45.2 44.7 35.8 38.5
41.7 44.9 ...
$ Salario_Mensual : num [1:50] 12200 14200 14300 13400 14700 15800
18800 15300 15500 14900 ...
$ Antiguedad_Anios : num [1:50] 5.5 5.7 3.6 5.5 5.6 3.6 8.7 5.9 2.6 6.3 ...
$ Capacitaciones_Anuales: num [1:50] 3 3 4 4 1 2 3 3 3 6 ...
$ Genero : chr [1:50] "Femenino" "Masculino" "Masculino"
"Masculino" ...
$ Departamento : chr [1:50] "Marketing" "Producción" "Recursos
Humanos" "Marketing" ...
# 2. estadística descriptiva para cada variable
#Estadistica descriptiva básica
> summary(data)
ID_Empleado Satisfaccion_Laboral Horas_Trabajo_Semanal Salario_Mensual
Min. : 1.00 Min. :4.060 Min. :30.00 Min. :11200
1st Qu.:13.25 1st Qu.:5.710 1st Qu.:37.52 1st Qu.:13250
Median :25.50 Median :6.650 Median :40.20 Median :15000
Mean :25.50 Mean :6.662 Mean :40.16 Mean :14924
3rd Qu.:37.75 3rd Qu.:7.508 3rd Qu.:42.98 3rd Qu.:15975
Max. :50.00 Max. :9.780 Max. :47.80 Max. :19900
Antiguedad_Anios Capacitaciones_Anuales Genero Departamento
Min. : 2.000 Min. :0.00 Length:50 Length:50
1st Qu.: 3.525 1st Qu.:2.00 Class :character Class :character
Median : 5.350 Median :3.00 Mode :character Mode :character
Mean : 5.168 Mean :2.68
3rd Qu.: 6.225 3rd Qu.:3.00
Max. :10.400 Max. :6.00
# Estadistica descriptivas adicionales
> describe(data)
vars n mean sd median trimmed mad min
ID_Empleado 1 50 25.50 14.58 25.50 25.50 18.53 1.00
Satisfaccion_Laboral 2 50 6.66 1.40 6.65 6.63 1.32 4.06
Horas_Trabajo_Semanal 3 50 40.16 4.20 40.20 40.29 4.08 30.00
Salario_Mensual 4 50 14924.00 2026.01 15000.00 14822.50 2298.03
11200.00
Antiguedad_Anios 5 50 5.17 1.78 5.35 5.07 1.85 2.00
Capacitaciones_Anuales 6 50 2.68 1.11 3.00 2.65 1.48 0.00
Genero* 7 50 1.48 0.50 1.00 1.48 0.00 1.00
Departamento* 8 50 2.54 1.07 2.00 2.55 1.48 1.00
max range skew kurtosis se
ID_Empleado 50.00 49.00 0.00 -1.27 2.06
Satisfaccion_Laboral 9.78 5.72 0.13 -0.55 0.20
Horas_Trabajo_Semanal 47.80 17.80 -0.25 -0.24 0.59
Salario_Mensual 19900.00 8700.00 0.34 -0.38 286.52
Antiguedad_Anios 10.40 8.40 0.47 0.11 0.25
Capacitaciones_Anuales 6.00 6.00 0.38 0.75 0.16
Genero* 2.00 1.00 0.08 -2.03 0.07
Departamento* 4.00 3.00 0.09 -1.32 0.15
# Visualizar la distribucion de una variable, por ejemplo, Salario Mensual
> ggplot(data, aes(x = Salario_Mensual)) +
+ geom_histogram(binwidth = 1000, fill = "blue", color = "black",
alpha=0.7)+
+ labs(title = "Distribución de Salario Mensual", x = "Salaraio Mensual", y =
"Frecuencia")
# Supongamos que "Satisfacción_Laboral", "Horas_Trabajo_Semanal", y
"Capacitaciones_Anuales son parte de un instrumento
> variables_instrumento <- data[c("satisfaccion_Laboral",
"Horas_Trabajo_Semanal", "Capacitaciones_Anuales")]
Error in `data[c("satisfaccion_Laboral", "Horas_Trabajo_Semanal",
"Capacitaciones_Anuales")]`:
! Can't subset columns that don't exist.
✖ Column `satisfaccion_Laboral` doesn't exist.
Run `rlang::last_trace()` to see where the error occurred.
> alpha(variables_instrumento)
Error: objeto 'variables_instrumento' no encontrado
> [Link](Salario_Mensual ~ Genero, data = data)
Welch Two Sample t-test
data: Salario_Mensual by Genero
t = -2.2641, df = 47.991, p-value = 0.02813
alternative hypothesis: true difference in means between group Femenino and
group Masculino is not equal to 0
95 percent confidence interval:
-2348.5773 -139.2432
sample estimates:
mean in group Femenino: 14326.92
mean in group Masculino: 15570.83
> leveneTest(Salario_Mensual ~ Departamento, data = data)
Levene's Test for Homogeneity of Variance (center = median)
Df F value Pr(>F)
group 3 0.2868 0.8347
46
Aviso:
In [Link](y = y, group = group, ...) : group coerced to factor.
> anova_result <- aov(Salario_Mensual ~ Departamento, data = data)
> summary(anova_result)
Df Sum Sq Mean Sq F value Pr(>F)
Departamento 3 9177653 3059218 0.733 0.538
Residuals 46 191953547 4172903
> ggplot(data, aes(x = Departamento, y = Salario_Mensual, fill =
Departamento)) +
+ geom_boxplot() +
+ labs(title = "Comparación de Salario Mensual por Departamento", x =
"Departamento", y = "Salario Mensual")
> [Link](Salario_Mensual ~ Departamento, data = data)
Kruskal-Wallis rank sum tes
data: Salario_Mensual by Departamento
Kruskal-Wallis chi-squared = 1.9627, df = 3, p-value = 0.5802
> [Link](Salario_Mensual ~ Genero, data = data)
Wilcoxon rank sum test with continuity correction
data: Salario_Mensual by Genero
W = 205, p-value = 0.03855
alternative hypothesis: true location shift is not equal to 0
Aviso:
In [Link](x = DATA[[1L]], y = DATA[[2L]], ...) :
cannot compute exact p-value with ties
Datos Variació N Mean Sd Median Trimme Mad
n d
ID empleado 1 50 22.50 14.58 25.50 25.50 18.53
1.00
Satisfacción 2 50 6.66 1.40 6.65 6.63 1.32
laboral
4.06
Horas de 3 50 40.16 4.20 4.20 40.29 4.08
trabajo
semanal
30.00
Salario 4 50 14924. 2026.0 15000. 14822.5 2298.
mensual 00 1 00 0 03
11200.00
Antigüedad 5 50 5.17 1.78 5.35 5.07 1.85
años
2.00
Capacitacion 6 50 2.68 1.11 3.00 2.65 1.48
es anuales
0.00
Genero 7 50 1.48 0.50 1.00 1.48 0.00
1.00
Departament 8 50 2.54 1.07 2.00 2.55 1.48
o
1.00
Datos Max Range skew kurtosis se
ID empleado 50.00 49.00 0.00 -1.27 2.06
Satisfacción 9.78 5.72 0.13 -0.55 0.20
laboral
Horas de 47.80 17.80 -0.25 -0.24 0.59
trabajo
semanal
Salario 19900.0 8700.00 0.34 -0.38 286.52
mensual 0
Antigüedad 10.40 8.40 0.47 0.11 0.25
en años
Capacitacion 6.00 6.00 0.38 0.75 0.16
es anuales
Genero 2.00 1.00 0.08 -2.03 0.07
Departament 4.00 3.00 0.09 -1.32 0.15
o
Data Salario mensual by genero
t= -2.2641
df= 47.991
p-value= 0.02813