TERCERA UNIDAD
_________________________________________________________
UNIDAD 3: CONFIABILIDAD Y VALIDEZ
Temas:
a) Confiabilidad: Concepto. Métodos para determinar la confiabilidad: Test-Retest, Formas
Alternas, entre Evaluadores, Consistencia interna, División por Mitades.
b) Validez: Concepto. Procedimientos para determinar la validez: validez aparente, validez
de contenido. Validez relacionada con el criterio: Concurrente y Predictiva. Validez de
constructo. Validez ecológica.
Bibliografía:
- Hogan, T. (2004). Pruebas psicológicas. Una introducción práctica. Caps. 4 y 5. Manual
Moderno.
- Mikulic, I.M. (2017). Introducción a la construcción y adaptación de tests. Ficha de cátedra.
Facultad de Psicología, Universidad de Buenos Aires.
VALIDEZ
- Es el grado en que la evidencia empírica y el sustento teórico permiten
interpretar las puntuaciones de un test bajo un determinado modelo. Es un
proceso continuo (no un acto único y puntual) con múltiples evidencias.
- Se refiere a lo que mide una prueba y no puede expresarse en general sino
que debe consignarse el uso particular para el que se planea usar el
instrumento.
- Se pregunta → ¿Mide la prueba el constructo que quiere medir? ¿Sirve para
el fin propuesto?
Aspecto básico. El aspecto básico consiste en ofrecer evidencia de que las
puntuaciones en una prueba son indicadores del rasgo o del constructo de interés,
esta evidencia refuerza la interpretación de dichas puntuaciones.
1- Validez de constructo
- Un constructo es una idea científica que se elabora para describir o explicar un
comportamiento determinado. Ej: la inteligencia, la ansiedad..
- Grado en que un conjunto de ítems observados reflejan un constructo teórico para
el que se los ha diseñado como medición.
- Análisis Factorial Exploratorio y Confirmatorio.
- Se pregunta → ¿En qué medida el instrumento refleja la teoría en la que se
sustenta? ¿Se mide el constructo tal como se lo define a nivel teórico?
Técnicas para medir la validez de constructo:
ANÁLISIS FACTORIAL: Estructura interna. Es una técnica estadística usada para
describir procedimientos matemáticos que permite identificar variables específicas
en las que pueden diferir las personas. Es empleado como un método de reducción
de datos. El propósito es identificar los factores en común.
EFECTO DE VARIABLES EXPERIMENTALES: Formulación de hipótesis y
confirmación. Es similar a los grupos de contraste que se dan de forma natural. Ej:
personas ansiosas y personas no ansiosas / mujeres y hombres. Busca establecer
la validez a través de la diferenciación entre grupos.
CORRELACIÓN CON OTRAS PRUEBAS: Asociación positiva con prueba validada.
Correlacionar la prueba que estoy validando con otras pruebas que tengan
adecuada validez y confiabilidad.
2- Validez de Contenido
- Grado en que el contenido (conjunto de ítems) corresponde a una muestra
representativa del universo de contenidos que interesa.
- Evaluación de jueces/expertos.
- Se pregunta → ¿Son los ítems de un instrumento suficientes y relevantes
para medir el constructo?
- La validez de contenido tiene que ver con la relación entre el contenido de una
prueba y cierto campo de conocimiento o comportamiento bien definido, debe haber
una correspondencia adecuada. La aplicación de la validez de contenido supone la
noción de muestreo, lo que significa que el contenido de la prueba abarca una
muestra representativa de todos los posibles contenidos del campo. Los ítems
deben ser representativos de las conductas a las que refiere el constructo.
- La validez de contenido se considera el tipo de validez más importante en las
pruebas de aprovechamiento. La finalidad normal de tales instrumentos consiste en
precisar el grado de conocimientos que se tienen sobre cierto conjunto material.
JUECES EXPERTOS: Evalúan la calidad, la relevancia y la suficiencia de los ítems.
Consiste en la entrega de un formulario compuesto por la consigna y por los ítems
que componen a la prueba y la tarea consiste en identificar a qué dimensión
corresponde cada uno de los ítems y que tan relevante es. Luego se da la definición
de cada dimensión.
3- Validez aparente: ¿La prueba parece medir lo que dice medir, es
aparentemente válida?
- Está vinculada a lo que la prueba parece medir, no es de las más relevantes, ya
que la simple apariencia no es una base suficiente para hacer inferencias
interpretativas.
4- Validez de Criterio
- Grado de relación entre las puntuaciones de un test y las puntuaciones en otra
variable (criterio).
- Correlación, regresión o modelización con ecuaciones estructurales (SEM)
- Consiste en establecer el vínculo entre el desempeño en la prueba y en algún otro
criterio que se toma como indicador importante del constructo de interés. Se
contrasta con un criterio externo.
VALIDEZ PREDICTIVA: ¿En qué medida es posible anticipar un logro o
comportamiento futuro? Se correlaciona el desempeño en la prueba con algún
criterio externo, establecido a futuro.
OBJETIVO: ANTICIPAR UN COMPORTAMIENTO O LOGRO FUTURO
MÉTODO: CORRELACIÓN CON CRITERIO EXTERNO A FUTURO
VALIDEZ CONCURRENTE: Se establece comparando las puntuaciones de una
técnica con un criterio externo, pero en forma inmediata y no a futuro MEDIDAS DE
CRITERIO EXTERNO. Ej: Otra prueba ya validada, calificaciones escolares,
registros de promoción, valoraciones de docentes o de jefes, diagnóstico realizado
por psicólogo clínico, etc.
OBJETIVO: EVALUAR UN RASGO ACTUAL
MÉTODO: CORRELACIÓN CON CRITERIO EXTERNO EN FORMA INMEDIATA
5- Validez ecológica
- Grado en que la prueba tiene sentido en el ámbito en el que se aplica. Insiste por
un lado en la semejanza entre las condiciones de investigación y las condiciones del
mundo real en que se produce un fenómeno; y por otro, en que el sujeto
experimente la situación de investigación con las mismas propiedades que el
investigador supone.
Resumen de validez:
1- La validez alude al grado en que la interpretación de la puntuación de una prueba
es apropiada para un determinado fin, es la característica más importante de una
prueba.
2- Los conceptos de sub presentación del constructo y varianza irrelevante del
constructo son útiles al considerar el grado de traslape entre una prueba y el
constructo que se pretende medir.
3- La validez aparente indica si una prueba parece válida, no es una demostración
empírica de la validez. Es útil principalmente con las pruebas de aprovechamiento y
empleo
4- La validez de contenido refiere la correspondencia entre el contenido de una
prueba y un conjunto de conocimientos o habilidades bien definido, se emplea
principalmente con las pruebas de aprovechamiento y empleo.
5-La validez relacionada con el criterio expresa el vínculo entre las puntuaciones de
la prueba y la condición en algún otro criterio que refleje el constructo de interés. La
condición en el criterio puede determinarse casi al mismo tiempo en que se aplica la
prueba( validez concurrente) o en algún momento ulterior (validez predictiva)
6- En la validez relacionada con el criterio , éste puede ser externo y realista un
grupo de contraste u otra prueba
7- Cuando la validez relacionada con el criterio se manifiesta como correlación entre
la prueba y el criterio, a la correlación se la denomina coeficiente de validez. Una
vez establecida , es posible recurrir a este coeficiente de validez para predecir la
condición en el criterio a partir de la puntuación en la prueba. Además, se puede
determinar el error estándar de estimación y utilizarlo para determinar las
probabilidades sobre la precisión de la estimación.
8- Todos los factores que influyen en la interpretación del coeficiente de correlación
incluido la linealidad, la homocedasticidad y la heterogeneidad del grupo , también
imperan en la interpretación de los coeficientes de validez.
9- La confiabilidad de la prueba y del criterio predominan en el coeficiente de
validez. Algunas fórmulas simples permiten corregir el coeficiente de validez de una
confiabilidad limitada(atenuada)
10- El criterio de interés debe definirse en forma operacional. con frecuencia existen
definiciones operacionales alternas que deben considerarse.
11-La contaminación del criterio alude a una situación indeseable, en la cual las
puntuaciones de la prueba influyen en la condición en el criterio. lo que incrementa
injustamente el coeficiente de validez.
12- La validez convergente y discriminante son conceptos útiles al considerar la
validez relacionada con el criterio. La validez convergente significa que la prueba
tiene una fuerte correlación con otras pruebas o fuentes de información que miden
el constructo meta de la prueba. La validez discriminante denota que la prueba
muestra una correlación baja con otras pruebas o fuentes de información, que son
indicadores de un constructo distinto.
13- No se debe confundir la validez con la precisión de las normas de una prueba.
Las normas de una prueba pueden ser deficientes pero la prueba aún es un
indicador válido de un constructo meta.
CONFIABILIDAD
Refiere a:
- La consistencia o estabilidad de los puntajes.
- La confianza que puede tenerse en una medición al margen del constructo
que mide exactamente.
- Sinónimos del concepto → replicabilidad, fiabilidad, consistencia y precisión,
- Una prueba confiable es aquella que consistentemente genera la misma
puntuación o una similar.
- Confianza y estabilidad que se puede tener en una medición.
- La confiabilidad permite saber hasta qué punto las diferencias en las
puntuaciones se deben a diferencias verdaderas existentes en las variables
que intentamos medir o hasta que punto se deben a errores del proceso de
medición.
- Se expresa a través del error → Toda medición contiene cierta cantidad de
error.
Los coeficientes de correlación y sus derivados , errores estándar y fórmulas
de predicción son elementos fundamentales en el estudio de la confiabilidad.
Cuatro factores que influyen en el coeficiente de correlación:
1- Linealidad
2- Heterocedasticidad
3- Posición relativa(no absoluta)
4- Heterogeneidad del grupo.
Principales fuentes de inestabilidad → Son estas fuentes de inestabilidad lo que
los índices de confiabilidad deben abordar. Nada que genere una variación no
sistemática en las puntuaciones de las pruebas es una fuente de inestabilidad. No
hay lista de fuentes que sean exhaustivas.
Cuatro categorías identificadas por ser fuente de variación no sistemática o
aleatoria:
1- Calificación de la prueba:
La variación en la calificación de la prueba como fuente de inestabilidad es una de
las más fáciles de entender. También es una de las que tienen mayor importancia
histórica.
La falta de acuerdo entre los calificadores puede generar una variación no
sistemática en las puntuaciones de las pruebas de las personas. Cuanto más juicio
exija la calificación, más preocupante será la posible fuente de inestabilidad o falta
de confiabilidad. Cuando se impone el juicio, la meta es contar con instrucciones de
calificación que sean lo suficientemente claras y explícitas a fin de que se reduzca al
mínimo la variación del calificador.
2- Contenido de la prueba:
Las variaciones en el muestreo de los reactivos de una prueba pueden generar un
error no sistemático en las puntuaciones de la misma.
Las puntuaciones de los individuos aumentan o disminuyen, tal vez en solo unos
cuantos puntos, quizás en más, no por diferencias reales en el rasgo que se mide,
sino por cambios más o menos aleatorios en el conjunto particular de reactivos que
se presentan en la prueba.
3- Aplicación de la prueba:
Una prueba debe contar con procedimientos estandarizados para su aplicación.
Esto incluye factores como las instrucciones, los límites de tiempo y las
disposiciones físicas para la aplicación. Si bien es imposible controlar todos los
detalles imaginables de la aplicación, estos pueden ejercer cierta influencia en las
puntuaciones de la prueba. (ruidos externos ante una evaluación, si el aplicador te
permite un poco más del tiempo establecido)
4- Condiciones personales.
Las condiciones personales de los examinados pueden ejercer influencias no
sistemáticas en sus puntuaciones en las pruebas. Es importante señalar que las
variaciones en estados factores no generan automáticamente inestabilidad o falta de
confiabilidad.
Teoría de la puntuación verdadera:
La confiabilidad de la prueba puede formularse en tres marcos conceptuales
ligeramente distintos, la teoría clásica de la prueba (TCP), la teoría de respuesta al
ítem (TRI) y la teoría de la generalizabilidad (TG).
La puntuación verdadera de una persona es → La puntuación que obtendría si se
eliminaran o suprimieran todas las fuentes de inestabilidad. Es la puntuación
promedio obtenida de varias aplicaciones de la prueba en diferentes momentos y
condiciones ligeramente distintas. Cada variación en las condiciones puede
introducir cierta inestabilidad. Cuando todas las puntuaciones observadas reales se
promedian, la media debe equivaler a la puntuación verdadera, esto es lo que
realmente deseamos conocer, aunque en la práctica nunca se logra determinarse
con certeza, en realidad solo se obtiene una puntuación observada.
La puntuación de error es → La diferencia entre la puntuación verdadera y la
puntuación observada. La teoría de la puntuación verdadera también puede
expresarse en términos de varianzas de las puntuación de las pruebas
1- MÉTODO TEST-RETEST:
- Evalúa: los cambios en las condiciones personales y en las condiciones de
aplicación
- Se obtiene aplicando la misma prueba a los mismos individuos en ocasiones
diferentes. Su margen de tiempo puede ser desde un día hasta un mes. ¿Qué
fuentes de inestabilidad? Los cambios en las condiciones personales, la influencia
ante los cambios en el contenido.
- Se obtiene coeficiente de estabilidad
- Contras: Dificultad para establecer tiempo entre las tomas, pocas practicidad,
depende del tipo de constructo que se mida (si es sensible a un cambio en el paso
del tiempo es importante que el intervalo de tiempo no sea tan extenso)
2- FORMAS EQUIVALENTES:
- Se preparan dos formas muestreo del contenido equivalentes de la misma técnica,
se las administra y se calcula la correlación entre los puntajes obtenidos por las
mismas personas.
- Busca evaluar falta de confiabilidad debido al muestreo del contenido.
- Contras:Reduce pero no elimina el efecto de la práctica (la persona se habitúa), es
costoso y hay dificultad para establecer equivalencia y diferencia entre las formas.
3- CONSISTENCIA INTERNA:
División por mitades → Consiste en separar en dos partes un mismo test.
Desventajas: como se divide la prueba en dos partes comparables (ej: si tiene un
nivel decreciente de dificultad en los ítems) y cual es el criterio de división si los
constructos son multidimensionales.
Coeficiente Alfa de Cronbach y Kuder -Richardson → Buscan medir la
característica común de la consistencia interna de una prueba. Es una medida
basada en las correlación entre los diferentes ítems que componen una misma
prueba.
En el caso de Alfa de Cronbach hay escalas de respuesta en donde las personas
deben elegir entre tres o más opciones y el de Kuder es dicotómico en donde las
personas responden por Sí o No.
4- INTERJUECES:
- Grado de acuerdo o consistencia que existe entre dos o más evaluadores. Una
fuente importante de varianza de error lo representa la varianza del evaluador.
- Se evalúa la variación no sistemática debida sólo a quienes califican la prueba.
- La confiabilidad entre calificadores aborda los errores no sistemáticos que surgen
de la variación en los calificadores. No trata ninguna otra fuente de error. La
información sobre la confiabilidad entre calificadores es particularmente importante
cuando el juicio interviene en el proceso de calificación.
Dos conclusiones importantes:
- En primer lugar , la longitud de la prueba es importante. La cantidad de reactivos
en la prueba siempre entra en las fórmulas, en general, mientras más larga sea la
prueba, más confiable será.
- La segunda conclusión consiste en que la confiabilidad se maximiza cuando el
porcentaje de examinados que responden correctamente una prueba de capacidad
cognitiva o que responden en cierta dirección en una prueba no cognitiva es
cercana a 50.
Error estándar de medición:
Un coeficiente de confiabilidad ofrece información importante sobre una prueba, sin
embargo también trae repercusiones. Para poder interpretar esas repercusiones es
necesario el error estándar de medición, el cual es la desviación estándar de una
cantidad hipotéticamente infinita de puntuaciones obtenidas en torno a la puntuación
verdadera de una persona.
Error estándar de medición vs. error estándar de la media → El error estándar
de medición es la desviación estándar de una población hipotética de puntuaciones
observadas distribuidas en torno a la puntuación verdadera de una persona. El error
estándar de la media, es la desviación estándar de una población hipotética de
medias de muestra para las muestras. Este último se utiliza para pruebas de
significación y para intervalos de confianza para medias de las muestras.
Resumen confiabilidad:
1) La confiabilidad, uno de los conceptos más importantes en la psicometría, se
relaciona con la consistencia o posibilidad de reproducir las puntuaciones de una
prueba.
2) Distinga entre confiabilidad y validez, entre el sentido psicométrico de la
confiabilidad y varios usos cotidianos que se le dan al término, entre cambio real y
fluctuaciones temporales en las mediciones y entre errores constantes y errores no
sistemáticos.
3) El coeficiente de correlación es el método más común para expresar la
confiabilidad, por tanto, es importante entender las correlaciones y los factores que
influyen en ellas.
4) Las principales fuentes de varianza inestable son la calificación de la prueba, el
contenido de la prueba, las condiciones personales del examinado.
5) En la teoría clásica de la prueba se emplean los conceptos de puntuación
verdadera, puntuación de error y puntuación observada.
6) Entre los métodos que se utilizan comúnmente para determinar la confiabilidad se
encuentran el método de confiabilidad test-retest, el de confiabilidad de la forma
alterna, el de confiabilidad entre calificadores y varios tipos de mediciones de la
consistencia interna. Cada método aborda algunas más no todas las fuentes de
inestabilidad o falta de confiabilidad.
7) Los conceptos de confiabilidad y error estándar se aplican por igual a los informes
narrativos y cuantitativos del desempeño de la prueba.
8) La confiabilidad es importante para la interpretación con referencia al criterio,
pero la situación en ocasiones exige atención en los modelos usuales para
determinar la confiabilidad.
Distinciones importantes entre validez y confiabilidad:
1) La validez se relaciona con lo que mide una prueba, específicamente si mide lo
que pretende medir, en tanto que la confiabilidad sólo se relaciona con la
consistencia de la medición, al margen de lo que mida exactamente. Una medición
puede ser confiable sin ser válida, aunque no puede ser válida a menos que sea
confiable.
2) Ser conscientes de las diferencias que hay en el uso cotidiano de la palabra
confiabilidad. Para ese uso podría utilizarse sinónimos como: consistencia,
replicabilidad y fiabilidad.
3) Distinguir entre cambio real en el rasgo medido y sus fluctuaciones de cambios
fugaces en las circunstancias personales.
4) Distinguir entre errores constantes y errores no sistemáticos en las mediciones.
5) El error aleatorio o no sistemático afecta la confiabilidad, el sesgo o error
sistemático afecta la validez.