JUICIO DE EXPERTOS.
PRUEBA
BINOMIAL. PRUEBA PILOTO Y
EVALUACIÓN DE LA
CONSISTENCIA INTERNA.
ALFA DE CROMBACH. KUDER
RICHARDSON.
Mg. Mattos Marreros Juana Miriam
Jmmattosm@[Link]
SEMANA 2
Escuela
Profesional de
Enfermería
JUICIO DE EXPERTOS.
PRUEBA BINOMIAL. PRUEBA
PILOTO Y EVALUACIÓN DE
LA CONSISTENCIA INTERNA.
SESIÓN 03
IDENTIFICACIÓN DEL PROBLEMA ¿?
Imagina que deseas evaluar el peso en
niños y el Instrumento (BALANZA) que vas
a usar esta MALOGRADA.
No Importa:
Si tu proyecto de investigación es
perfecto
Si tu muestra es representativa Si el instrumento con
el que recolecta los
Si contratas al mejor estadístico del
mundo datos no esta
validado
Si invertiste mucho dinero y mucho
tiempo Entonces las conclusiones
Simplemente los resultados no sirven. que se obtenga con esos
datos, tampoco son
validas,
Requisitos de
la Medición
Validez Confiabilidad
Validez de Validez de Validez de
Contenido Criterio Constructo
VALIDEZ
Grado en que un instrumento mide la variable que
pretende medir. La validez implica congruencia en la
manera de plantear las preguntas.
Grado en que un instrumento refleja un dominio específico de contenido de lo
que se mide. Es el grado en que la medición representa al concepto medido. Ejm:
Contenido Una prueba de operaciones aritméticas no tendrá validez de contenido si incluye
sólo problemas de adición y excluye problemas de sustracción, multiplicación y
división (Validez de juicio de experto).
Validez Se establece la validez comparándolo con algún criterio externo. Es un criterio
Criterio estándar con el que se juzga la validez de un instrumento. Para ellos se usa el
Total Coeficiente de Contingencias, Spearman – Brow o Pearson.
Se refiere al grado en que una medición se relaciona consistentemente con otras
Constructo mediciones de acuerdo con hipótesis derivadas teóricamente y que conciernen a
los conceptos (o constructos) que están siendo medidos. Se usa el Análisis de
Factores y Análisis de Cofactores, el Análisis de Covarianza.
A. VALIDACIÓN DE UN INSTRUMENTO A TRAVÉS DEL JUICIO DE EXPERTOS
Juicio de Expertos: El juicio de expertos se establece recopilando opiniones emitidas por personas
calificadas en las variables a investigar; se busca constatar si es coherente la relación entre las
preguntas (reactivos ó ítems) que incluye el instrumento y las variables (con sus dimensiones, si las
tuviera) a ser medidas con dicho cuestionario.
Pasos a seguir:
1. Seleccionar a sus jueces expertos (mínimo 06 jueces)
2. Una vez seleccionados los jueces expertos se les enviará:
- Un oficio,
- La matriz de consistencia del proyecto,
- El cuadro de operacionalización de variables
- El instrumento de recolección de datos (o los…) y
- Formato de evaluación del instrumento.
3. Se les dará a los jueces el plazo prudencial de una semana para que respondan. Trate de
recibir las observaciones personalmente pues el diálogo suele ser muy enriquecedor y le harán
notar detalles de los cuales usted no se había percatado.
4. Una vez que usted haya conseguido las respuestas de seis jueces como mínimo se procede a
la evaluación cualitativa y cuantitativa de las mismas.
La evaluación Cualitativa: Consiste en considerar todas las sugerencias, aportes que han escrito
los jueces en el instrumento; ello ayuda al investigador a mejorar las preguntas del cuestionario,
y de ser necesario eliminar aquellas que no tienen relación con la dimensión/variable que se
está midiendo.
La evaluación Cuantitativa: es más general, pues valora al instrumento en su totalidad
cubriendo diferentes aspectos como son la coherencia con los objetivos, su estructura y
comprensibilidad. Se realiza mediante la prueba binomial.
5. Procedimiento para la aplicación de la prueba binomial:
a. En una hoja Excel vaciar las respuestas de los jueces expertos según el cuadro vacío
siguiente. La columna de ítems se refiere a los que se emplearon en la “Escala de calificación
del juez experto”. En cada celda del cuadro vacío digitará ‘1’, si es que el juez respondió
FAVORABLEMENTE y ‘0’ si respondió DESFAVORABLEMENTE.
b. Colocar el cursor en la celda correspondiente al ítem 1 de la columna p valor y en la
celda Fx digitar: =[Link](5;6;0.5;0)
num_exito=suma
ensayos=num. jueces
prob_éxito=0.5
acumulado=Falso
Cuando el p valor es menor que 0.05 significa que si hay concordancia entre los jueces. Repetir el
procedimiento para los seis ítems restantes.
Conclusiones:
- Los ítems: 3, 5, 6, 8, 9, y 10 tienen un p valor < 0.05, por lo tanto si existe concordancia entre los
jueces para dichos ítems.
- Los ítems: 1, 2, 7 y 11 tienen el p valor > 0.05. Por lo tanto no hay concordancia entre los jueces,
se debe revisar en la parte cualitativa las razones por las cuales los jueces han opinado así.
- En el ítem N° 3 el p valor <0.05 por lo tanto hay concordancia entre los jueces, ellos acuerdan
en que está “fallando” el instrumento en dicho ítem; se debe revisar la parte cualitativa para
re-estructurar el cuestionario.
6. Procedimiento para determinar el porcentaje de concordancia entre los jueces Para evaluar
en conjunto todos los ítems del formato de los jueces expertos o si es que no hubiese conseguido
los jueces necesarios para hacer la prueba binomial entonces podrá calcular el ‘porcentaje de
acuerdo entre los jueces’ de la siguiente manera:
a. En una hoja Excel llene el cuadro que se le indicó anteriormente. (ver cuadro anterior)
b. Tenemos un total de 66 respuestas (11 items x 6 jueces) de las cuales 56 son “1” y 10 son “0”.
Aplicamos la siguiente fórmula, donde:
‘b’ = Grado de concordancia entre jueces;
‘Ta’ = n° total de acuerdos;
‘Td’ = n° total de desacuerdos.
b= Ta x 100 Reemplazamos por los valores obtenidos
Ta + Td
b= 56 x 100 = 85.0% el 85% de las respuestas de los jueces concuerdan.
56 + 10
“Validación y confiabilidad del Cuestionario AQ-27 de actitudes estigmatizadoras
hacia pacientes con esquizofrenia en un Hospital General – 2024”. Bolívar-Paredes,
E., & Villanueva-Ruska, A. (2017).
ITEMS Juez1 Juez2 Juez3 Juez4 Juez5 Juez6 P valor
1 1 1 1 1 1 0 0.0938
2 1 1 1 1 1 0 0.0938
3 0 0 0 0 0 0 0.0156
4 1 1 1 1 1 1 0.0156
5 1 1 1 1 1 1 0.0156
6 1 1 1 1 1 1 0.0156
7 1 1 0 1 1 1 0.0938
8 1 1 1 1 1 1 0.0156
9 1 1 1 1 1 1 0.0156
10 1 1 1 1 1 1 0.0156
11 1 1 0 1 1 1 0.0938
Tabla 2
Validez de contenido por medio de cinco jueces de la escala EON de Jimenez (2018)
Ítem Juez 1 Juez 2 Juez 3 Juez 4 Juez 5
Aciertos V. de Aiken Aceptable
P R C P R C P R C P R C P R C
1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
2 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
3 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
4 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
5 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
6 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
7 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
8 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
9 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
10 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
11 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
12 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
13 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
14 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
15 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
16 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
17 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
18 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 15 1.00 Sí
Nota: No está de acuerdo = 0, sí está de acuerdo = 1; P = Pertinencia, R = Relevancia, C = Claridad
En la tabla 2, se aprecia que los cinco jueces expertos consultados coinciden en
manifestar su acuerdo con respecto a los 18 reactivos que se formulan, alcanzando
un coeficiente V de Aiken de 1.00 lo que indica que este test reúne evidencias
(pertinencia, relevancia y claridad) de validez de contenido pues los valores son
>0.85.
Prueba Piloto
La prueba piloto consiste en aplicar TODO el procedimiento que se realizará con la muestra
final a personas con características semejantes a las de la muestra del estudio, con el
objetivo de poner a prueba la metodología, la muestra, la funcionalidad de los instrumentos,
el análisis de los datos, es decir la logística y por ende la viabilidad del proyecto de
investigación.
Consideraciones:
• Las personas encuestadas en la prueba piloto no deben ser parte de la muestra para el
estudio definitivo.
• Las personas encuestadas en la prueba piloto deben tener las mismas características de la
que muestra del estudio (por ejemplo sexo y edad), pero al mismo tiempo deben
representar la máxima heterogeneidad de la población - diferentes estratos.
• La selección de las unidades de análisis para el piloto se hace siguiendo los mismos
principios del muestreo que se utilizará para la muestra del estudio definitivo. Este proceso
tiene la ventaja de obtener una muestra más representativa para llevar a cabo el pretest o
prueba piloto. Pero al mismo tiempo puede significar un alto costo, dependiendo del
tamaño total de la población.
• Si después de calcular los índices de consistencia interna (alfa de Cronbach, Prueba de
Kuder Richardson), el cuestionario no obtuvo los valores óptimos se debiera repetir la pre-
prueba.
Tamaño de la muestra piloto
• El tamaño de la muestra para el estudio piloto es menor al de la muestra para el estudio
definitivo.
• Argimón y Jiménez señalan que el tamaño de muestra del piloto debe ser mayor al
número de ítems, y el número total de personas debe ser entre dos y diez veces el número
total de ítems.
• Ruiz y Morillo señalan que se debe aplicar el instrumento a 20 ó 30 personas; mientras que
Hernández Fernández y Baptista señalan que si la muestra final es de 300 ó más, se lleve a
cabo la prueba piloto con 30 a 60 personas (o sea entre el 10% y el 20%).
• Chávez de Paz sugiere que se tome como referencia el tamaño de la muestra para el
estudio definitivo y a partir de ella (como si fuera el tamaño del universo), utilizando la
fórmula estadística adecuada, se calcule el tamaño de la muestra para la prueba piloto.
ALFA DE CROMBACH.
KUDER RICHARDSON.
SESIÓN 4
CONFIABILIDAD
Se refiere al grado en que su aplicación de un
instrumento repetida al mismo sujeto produce iguales
resultados” Hernández, Fernández y Bastita (1998)
“(p.21)
Se refiere a la consistencia de los resultados. En el
análisis de la confiabilidad se busca que los
resultados de un cuestionario concuerden con los
resultados del cuestionario en otra ocasión.
Menéndez (2009)
Se refiere al grado en que su aplicación repetida al
mismo sujeto u objeto produce iguales resultados. Silva
(2009)
Estabilidad y Seguridad Precisión Consistencia
Reproducibilidad
Interna u
Predictibilidad
Homogeneidad
Los procedimientos mas utilizados son:
Test – Retest (Medida de estabilidad)
- Un mismo instrumento es aplicado dos o mas veces a un mismo grupo de personas en
condiciones similares. Si la correlación entre los resultados de las diferentes aplicaciones es
altamente positiva, el instrumento se considera confiable.
Debilidades:
- El periodo de tiempo (corto – largo) entre las mediciones puede confundir el coeficiente de
confiabilidad.
Medidas Paralelas o Formas Equivalentes
- Dos versiones diferentes pero equivalentes, se administra a un grupo de personas.
Debilidades:
- Pruebas realmente paralelas Implica doble trabajo.
- Confiable solo si la correlación entre los resultados de ambas aplicación es positiva.
División por Mitades o Mitades Partidas
- Una prueba fragmentada en dos partes equivalente.
Alfa de Cronbach, Kuder Richarson, Alpha ordinal y Coeficiente Omega (cumpliendo las
condiciones para su aplicación)
Técnica: Alfa de Cronbach
- Es un coeficiente que sirve para medir la fiabilidad de una escala de medida, y cuya
denominación Alfa fue realizada por Cronbach en 1951. Considerada también una medida de
coherencia o consistencia interna, su cálculo sólo incluye una aplicación.
- Requiere sólo una aplicación del instrumento de medición. Produce valores que oscilan entre
cero (0) y uno (1).
- No es necesario dividir en mitades los ítems del instrumento. Se aplica la medición y se
calcula el coeficiente.
Condiciones de aplicación
- Estar formado por un conjunto de ítems que se combinan aditivamente para hallar una
puntuación global (esto es, la puntuaciones se suman y dan un total que es el que se interpreta).
- Todos los ítems miden la característica deseada en la misma dirección. Es decir, los ítems de
cada una de las escalas tienen el mismo sentido de respuesta (a mayor puntuación, más
ansiedad, por ejemplo)
k:nùmero de ìtems en la prueba.
K S
2
= 1 − 2
i
Si2:es la suma de var ianza de cada ìtem
K − 1 St St2:es la var ianza del total de filas
En este caso, el análisis se realizo a través del
Alpha de Cronbach (10% de la población objeto
de estudio ):
Para el puntaje de los ítems, se utilizó la escala de
Likert, de la siguiente forma:
Totalmente De Acuerdo: 5 puntos
De Acuerdo: 4 puntos
Neutral: 3 puntos
En Desacuerdo: 2 puntos
Totalmente en Desacuerdo: 1 punto
K= Número de Ítems.
S2= Varianza de los puntajes de cada ítems.
S2T= Varianza de los puntajes totales.
a = 0.81
Estadísticos de
Tabla: Escala de Valoración del Alfa de Cronbach
fiabilidad
Valor Alfa de Cronbach Apreciación Alfa de N de
Cronbach elementos
[0.95 a + > Muy elevada o Excelente
[0.90 - 0.95> Elevada
[0.85 - 0.90> Muy buena
0.65 10 ,05
[0.80 - 0.85> Buena
[0.75 - 0.80> Muy Respetable
[0.70 - 0.75> Respetable Se alcanzo un Nivel de
[0.65 - 0.70> Mínimamente Aceptable Confiabilidad Bueno con
[0.40 - 0.65> Moderada un Alpha = 0.81, siendo
[0.00 - 0.40> Inaceptable
este test consistente y
Fuente: De Vellis (1991)
adecuado para el
estudio
La correlación debe ser superior a 0.35 (Cottien-Manium
(1990)) para ser considerado en el cuestionario. El ítem 10 no
cumple.
Para la motivación intrínseca:
Estadísticos de fiabilidad
Alfa de N de
Cronbach elementos
0.839 5
Se alcanzo un Nivel de Confiabilidad
Bueno con un Alpha = 0.839
Para la motivación extrínseca :
Estadísticos de fiabilidad
Alfa de N de
Cronbach elementos
0.523 5
Se alcanzo un Nivel de Confiabilidad
Moderado con un Alpha = 0.523
Coeficiente de Kuder Richarson
Esta herramienta sirve para determinar el nivel de confiabilidad de una prueba de
eficiencia. Para determinar el coeficiente se deben realizar los siguientes pasos:
1ª Establecer la validez del instrumento.
2ª Aplicar el instrumento a una muestra piloto.
3ªAsignar “1” a los reactivos de respuesta correcta y “0” a los de respuesta incorrecta.
- Permite calcular la confiabilidad con una sola aplicación del instrumento.
- No requiere el diseño de pruebas paralelas.
- Es aplicable sólo en instrumentos con ítems dicotómicos, que puedan ser codificados
con 1– 0 (correcto –incorrecto, presente – ausente, a favor – en contra, etc.).
K pq
k:nùmero de ìtems en la prueba.
KR20 = r20 = 1 −
p:proporciòn de personas que contestaron correctamente a un reactivo.
K −1 St2 q = 1-p
St2:Varianza muestral de la prueba o de las puntuaciones.
TESINA: GESTIÓN DE RESIDUOS SÓLIDOS Y SU INFLUENCIA EN LA CONCIENCIA
AMBIENTAL DE LA INSTITUCIÓN EDUCATIVA SANTA MARÍA DE LA
ESPERANZA,2015
AUTOR: CULQUITANTE VIGO, JEISSEN RONALD
CUESTIONARIO DE ACTITUD HACIA LOS RESIDUOS SÓLIDOS
RESPUESTAS
ITEM PREGUNTAS SI NO
¿Consideras que los tipos de residuos solidos que se
generan en tu Institución Educativa pueden ser
1 reaprovechados?
¿Considera Usted que al reducir, reusar, reciclar sus
propios residuos sólidos, está mejorando su
2 ambiente?
¿Te molesta que en tu Institución Educativa se
3 genere bastantes residuos sólidos?
¿Corriges a las personas que arrojan sus residuos
4 sólidos al suelo?
¿Crees que es importante caracterizar y
reaprovechar los residuos sólidos que se generen
5 en tu Institución Educativa ?
¿Colabora Usted con el reciclaje de los residuos
6 sólidos?
¿Consideras que es importante separar los residuos
7 sólidos?
¿Estas dispuesto a colaborar con el estudio de
caracterización y reciclaje que se realizará dentro
8 de tu Institución Educativa?
La confiabilidad Kuder Richardson es similar al Alpha de Crombach pero se utiliza para
respuestas dicotómicas, como se muestra en el siguiente ejemplo:
Items en el instrumento
Encuestados 1 2 3 4 5 6 7 8 sumatoria de los aciertos de los items
k p*q
1 1 1 1 1 1 1 1 1 8 Kr = 1 −
2 1 1 1 1 1 1 1 1 8 k −1 St 2
3 0 0 1 1 0 1 0 0 3
4 1 1 0 0 1 0 1 0 4
5 1 1 0 1 1 1 1 1 7 8 1.55
Kr = 1−
6 0
7 1
0
1
1
1
1
0
0
1
0
1
1
1
1
1
4
7
8 − 1 4.12
8 1 1 1 1 0 1 1 1 7
9 1 0 1 1 1 0 0 1 5 Kr = 0.71
10 0 1 0 0 1 1 0 1 4
11 1 1 0 1 0 1 0 0 4
12 1 0 0 0 0 0 1 1 3 Confiabilidad
13 1 1 1 1 1 1 1 1 8
14 1 1 1 1 1 1 1 1 8 Respetable
15 1 1 1 1 1 1 1 1 8 según Escala de
Total
p
12
0.8
11
0.7
10
0.7
11
0.7
10 11
0.7 0.7
11
0.7
12
0.8
4.12 varianza de los aciertos
Vellis
q 0.2 0.3 0.3 0.3 0.3 0.3 0.3 0.2
pxq 0.2 0.2 0.2 0.2 0.2 0.2 0.2 0.2 1.55 sumatoria pxq
P=Total/N° encuestados
p: proporción de aciertos q: 1-p Varianza de los aciertos
por parte de los
encuestados
FACTORES QUE PUEDEN AFECTAR LA CONFIABILIDAD
Y LA VALIDEZ
La improvisación. Algunas personas creen que elegir un instrumento de medición o desarrollar
uno es algo fácil y que no requiere de supervisión alguna.
La traducción, aún cuando adaptemos los términos a nuestro lenguaje esto no es ni
remotamente validarlo.
La inadecuación o falta de empatía. Hay instrumentos que tienen un lenguaje muy elevado
para el entrevistado o no toma en cuenta diferencias de sexo, edad, nivel ocupacional y
educativo.
Las condiciones de aplicación. El ruido, presionar para que una persona conteste un
instrumento largo en un período de tiempo corto, el hambre o falta de motivación para
responder influirá negativamente en la validez y confiabilidad de la medida.
Los aspectos mecánicos. Que el instrumento tenga instrucciones precisas, que se lea bien (si se
trata de un cuestionario escrito), que no le falten páginas, que haya un espacio adecuado
para contestar.