0% encontró este documento útil (0 votos)
2 vistas10 páginas

Tema 1. Repaso de Estadística I y II. Variables Aleatorias.: de Razón de Intervalo

El documento repasa conceptos fundamentales de estadística, incluyendo variables aleatorias, tipos de datos y métodos de análisis. Se distingue entre estadística descriptiva, que resume datos de una muestra, y estadística inferencial, que permite hacer generalizaciones sobre una población. Además, se aborda el contraste de hipótesis y su aplicación en la investigación, destacando la importancia de la formulación de hipótesis y el análisis de resultados.

Cargado por

aliper10
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas10 páginas

Tema 1. Repaso de Estadística I y II. Variables Aleatorias.: de Razón de Intervalo

El documento repasa conceptos fundamentales de estadística, incluyendo variables aleatorias, tipos de datos y métodos de análisis. Se distingue entre estadística descriptiva, que resume datos de una muestra, y estadística inferencial, que permite hacer generalizaciones sobre una población. Además, se aborda el contraste de hipótesis y su aplicación en la investigación, destacando la importancia de la formulación de hipótesis y el análisis de resultados.

Cargado por

aliper10
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Tema 1. Repaso de Estadística I y II.

Variables aleatorias.
Se extraen de la observación y el análisis de la medición a un conjunto de individuos que
reúnen una o varias características comunes: población y muestra.
Parámetro (N) = Población. Se representa con letras griegas.
Muestra (n) = una parte representativa de la población. Se representa con letras latinas.

Parámetro (letras griegas) Estadístico (letras latinas)

Media µ 𝑋
Varianza 2 2
𝑆 𝑥𝑆 𝑦
2
σ
Desviación típica σ𝑥 𝑆𝑥 𝑆𝑦

Las variables aleatorias pueden clasificarse en:


●​ Nominal (cualitativas): informan de la cualidad, pero no son cuantificables. [Link]. El
color de pelo es una característica que presenta diferentes modalidades: moreno,
rubio, castaño o pelirrojo, que no implican grados en los que se expresa la
característica ya que pelirrojo no es más que rubio, y viceversa. Se usa la moda.
●​ Ordinal (cuasi-cuantitativas): expresan cualidades y el grado en el que se expresan
las mismas, permite ordenar de mayor a menor, pero no se puede cuantificar. ([Link].
Clase alta, clase media, clase baja), no se puede establecer la diferencia entre
grados, sólo podemos afirmar que medio es más que bajo y medio es menos que
alto, pero es subjetivo. Se usa la mediana.
●​ Escala (cuantitativas): informan de la cualidad, grado y cantidad, establecen valores
numéricos concretos, que nos permite observar todo lo anterior y además nos
permite definir el intervalo entre variables. [Link]. El CI, la altura, etc. Se usa la media.
○​ De razón: siempre son unidades físicas donde el 0 es absoluto y universal,
indicando ausencia de. [Link]. kilogramos, metros, segundos, litros, etc.
○​ De intervalo: el 0 es arbitrario decidido externamente. [Link]. Un examen, el
profesor marca el orígen (la dificultad): no es lo mismo un 0 en sumas y
restas que un 0 en probabilidad, no saber probabilidad no excluye el saber
sumar y restar. La temperatura es otro ejemplo, en este caso el 0 no significa
ausencia de temperatura, no existe la ausencia de temperatura ya que puede
haber -Xº bajo 0.

A su vez, las variables cuantitativas pueden ser:


●​ Discretas o Categóricas: sólo puede tomar valores enteros, no existen valores
intermedios. [Link]. El número de hijos, puedes tener 1, 2, 3, pero nunca 1.5 hijos.
●​ Continuas: puede haber infinitos valores intermedios. [Link]. tiempo, peso, longitud, las
variables psicológicas…
Estadística descriptiva.

La población representa un conjunto de elementos que presentan una o varias


características en común que nos interesa conocer, sin embargo, su medición es
inabarcable, por lo que empleamos la muestra.
La muestra es un subconjunto representativo de la población que se extrae mediante el
muestreo, procedimiento que garantiza dicha representatividad (grado en que cada
elemento de la población tuvo oportunidad de ser escogido).
Empleamos los estadísticos para describir la muestra, y a partir de estos datos muestrales,
obtenidos de la observación de variables aleatorias, empleamos parámetros que nos
permiten inferir las características poblacionales.

La estadística descriptiva puede clasificarse en:


●​ Univariada: es el conjunto de técnicas estadísticas enfocadas en el análisis,
resumen y descripción de una sola variable a la vez, sin establecer relaciones entre
ellas. Permite organizar datos (cualitativos o cuantitativos) mediante frecuencias,
medidas de tendencia central (media, mediana, moda), dispersión (varianza,
desviación estándar) y gráficos (histogramas, barras) para caracterizar la distribución
de una única característica.
Para describir o caracterizar una muestra se emplean diferentes tipos de
estadísticos:
○​ Tendencia central: es el número que mejor representa la muestra.
Dependiendo del tipo de variable se usa un estadístico u otro: media
(cuantitativa), mediana (ordinal) y moda (nominal).
○​ Dispersión: cuánto varía la variable en la muestra, cuánto se diferencian o se
alejan los sujetos de la media. [Link]. Varianza, desviación típica, amplitud
intercuartil, etc.
○​ Asimetría y curtosis: permiten analizar la forma de la distribución de una
variable cuantitativa. La asimetría mide el grado de simetría de la distribución
respecto a su media (simétrica, asimétrica positiva - mayoría de valores bajos
- y asimétrica negativa - mayoría de valores altos).
La curtosis mide el apuntamiento de la distribución, es decir, cuánta masa de
probabilidad se concentra en torno a la media, en comparación con una
distribución normal.
Tanto la asimetría como la curtosis suelen acompañarse de un error típico
(SE) que nos ayuda a decidir si el valor de la desviación respecto a la
normalidad es estadísticamente significativo. Esto ayuda a decidir si es
necesario aplicar transformaciones a los datos o usar pruebas no
paramétricas.
○​ Posición (Centiles): dividen un conjunto de datos ordenados en 100 partes
iguales. Cada centil indica el valor por debajo del cual se encuentra un
porcentaje determinado de observaciones.
○​ Puntuaciones Z y transformaciones: son una transformación lineal que
expresa cuántas desviaciones típicas se aleja un valor de la media de su
distribución.
●​ Bivariada: analiza simultáneamente dos variables (X e Y) para determinar la
existencia, intensidad y dirección de la relación o correlación entre ellas. Utiliza
herramientas gráficas y numéricas, como tablas de contingencia y correlación, para
describir cómo cambia una variable al variar la otra.
comparación vs relación, correlación, tablas de contingencia, representación gráfica.
●​ Multivariada: analiza conjuntos de datos con dos o más variables simultáneamente,
buscando describir patrones, relaciones y estructuras subyacentes entre ellas en
una muestra. Utiliza herramientas gráficas y numéricas para organizar y resumir
datos complejos de múltiples características.

Probabilidad.
Proporciona un marco formal para predecir la posibilidad de que ocurra un suceso,
basándose en un conjunto de reglas y principios.
●​ Variables aleatorias: asigna un valor numérico a cada resultado posible de un
experimento aleatorio.
●​ Función de densidad: para variables aleatorias continuas, la función de densidad f(x)
describe la distribución de probabilidad. El área bajo la curva en un intervalo
representa la probabilidad de que la variable tome valores en dicho intervalo.

●​ Función de distribución: para cualquier variable aleatoria X, la función de distribución


F(x) se define como: 𝐹(𝑥) = 𝑃(𝑋 ≤ 𝑥). Representa la probabilidad acumulada hasta
el valor x.

:
●​ Variables discretas:
○​ Binomial: número de éxitos en n ensayos independientes cuando sólo hay
dos posibles resultados: éxito/fracaso. [Link]. número de veces que se puede
sacar cara (éxito) si tiras una moneda al aire 10 veces.
○​ Multinomial: número de éxitos en n ensayos independientes cuando hay más
de dos posibles resultados. [Link]. ¿Cuál es la probabilidad de que en 20
lanzamientos de dados salga exactamente 4 veces el número 1?
○​ Uniforme discreta: todos los valores tienen la misma probabilidad. [Link].
Lanzar un dado tiene 6 posibles resultados, cada resultado con la misma
1
probabilidad de ocurrencia:
6
●​ Variables continuas:
○​ Distribución Normal o Gaussiana: por ejemplo, si el CI tiene media 100 y
desviación típica 15, una persona con CI 115 está 1 desviación típica por
encima de la media.
○​ T student: se emplea cuando la muestra es muy reducida, nos sirve para ver
si hay diferencias significativas.
○​ Ji-cuadrado: se emplea cuando hay una distribución asimétrica positiva, nos
sirve para analizar la relación entre variables.
○​ F de Snedecor: se emplea cuando hay una distribución asimétrica positiva
(con dos grados de libertad), sirve para comparar más de dos grupos entre sí
y ver si presentan diferencias significativas (ANOVA o regresión múltiple).

Estadística inferencial.
Nos permite extraer conclusiones sobre una población completa a partir del estudio de una
muestra representativa. A diferencia de la estadística descriptiva, que se limita a resumir y
presentar los datos observados, la inferencial da el salto hacia la generalización y la toma
de decisiones bajo incertidumbre.
Distintas muestras de la misma población producirán estadísticos ligeramente diferentes
(media, desviación típica, proporción, etc). Esta variabilidad se cuantifica mediante el error
estándar (desviación típica de la distribución muestral de un estadístico) y el intervalo de
confianza (intervalo alrededor del estadístico donde probablemente se encuentra el
parámetro).

Relacionamos los estadísticos y los parámetros mediante cálculos probabilísticos:


1.​ Estimamos la probabilidad de obtener cierto resultado en la muestra si la hipótesis
nula es cierta (valor p).
2.​ Construimos el intervalo de confianza en el que se encuentra el parámetro con un
nivel de confianza determinado.
3.​ Realizamos el contraste de hipótesis para decidir si los datos apoyan o rechazan la
hipótesis nula sobre la población.

Contraste de hipótesis (NHST).


a.​ Pregunta de investigación: ¿A qué edad se aprende a nadar?
b.​ Definición operativa: se entiende nadar como mantenerse a flote en líquido, y
aprender como la capacidad de integrar información para cumplir un objetivo. La
edad medida en tiempo (años) desde el nacimiento.
1.​ Formulación de hipótesis:
𝐻0: µ𝑒𝑑𝑎𝑑.𝑛𝑎𝑑𝑎𝑟 = 5
𝐻1: µ𝑒𝑑𝑎𝑑.𝑛𝑎𝑑𝑎𝑟 ≠ 5
2.​ Supuestos: generales (aleatorización, independencia, tamaño muestral) y
específicos del tipo de prueba (normalidad de la distribución, homocedasticidad,
escala de medida).
3.​ Estadístico de contraste: selección del más adecuado y cálculo del valor a partir de
los datos muestrales.
4.​ Regla de decisión y cálculo del nivel crítico: es un criterio preestablecido que
determina cuándo rechazamos o no rechazamos la hipótesis nula (H0) en función de
los resultados del contraste estadístico. Es el umbral que separa lo "suficientemente
improbable" de lo "razonablemente probable" si H0 fuera cierta. Para ello
necesitamos el nivel de significación o α, que es la probabilidad máxima que
estamos dispuestos a aceptar de cometer un Error Tipo I (rechazar H0 cuando en
realidad es verdadera). Y el valor crítico (p), que representa el punto en la
distribución muestral que separa la región de rechazo de la región de no rechazo.
5.​ Decisión y conclusión:
●​ Si 𝑝 ≤ α → RECHAZAMOS H0.
●​ Si 𝑝 > α → MANTENEMOS H0

[Link]. Con un 95% de confianza, los datos son lo suficientemente pronunciados como
para que sea razonable concluir que la H0 es falsa.

6.​ Tamaño del efecto: cuantifica la magnitud de una diferencia, asociación o efecto,
independientemente del tamaño muestral. Un valor p significativo (p < 0.05) solo nos
dice que hay un efecto, pero no cómo de grande es.
7.​ Análisis de la potencia: es la probabilidad de detectar un efecto cuando realmente
existe.
8.​ Estimación de parámetros (ICs): mediante intervalos de confianza. Para interpretar
los intervalos de confianza debemos tomar de referencia el valor de µ𝐻0, en nuestro
ejemplo 5, si el intervalo contiene ese valor, mantenemos la hipótesis nula, pero si el
valor de µ𝐻0 está fuera del intervalo de confianza, rechazamos la hipótesis nula.
Decisión para el contraste de hipótesis.

Una variable. Dos variables. Más de dos variables.

Continua: media o mediana. Ambas continuas u ordinales: asociación o Variable Dependiente Continua:
relación.
Si asumen normalidad Para diseños factoriales → ANOVA
(paramétricas) → Z (si Continuas → r de Pearson. factorial (efectos principales e
conocemos σ poblacional) o T interacciones)
(si no conocemos σ Ordinales → r de Spearman.
poblacional). Regresión múltiple (predice una VD
Regresión simple → Coeficiente B continua a partir de varias VI).
Si no asumen normalidad (no (predecir una variable a partir de otra).
paramétricas) → Wilcoxon.

Discreta: proporción. Ambas discretas: mediante tablas de Otras situaciones:


contingencia.
Binomial (2 categorías Para una VD categórica/dicotómica →
dicotómicas). Prueba ji-cuadrado (χ2) → [Link]. Relación Regresión logística (probabilidad de
género - preferencia política. pertenencia a una categoría).
Multinomial (más de 2
categorías). McNemar → tablas 2x2 para medidas Para tablas de contingencia múltiples
repetidas. [Link]. ¿Cambia la preferencia → Regresión log-lineal (relaciones
política después de un discurso? entre más de 2 variables categóricas).

Para modelos avanzados → Modelos


lineales generalizados o Modelos
mixtos.

Una continua y otra discreta (2 grupos):

Para diseños independientes (grupos


diferentes) → prueba t (si se cumplen los
supuestos) o prueba U de Mann-Whitney
(no paramétrico).

Para diseños relacionados (mismos sujetos)


→ prueba t (medidas repetidas) o
Wilcoxon (no paramétrica).

Una continua y otra discreta (+ de 2


grupos):

Para diseños independientes (grupos


diferentes)
→ ANOVA unifactorial (compara medias de
k grupos) o Kruskal-Wallis (no
paramétrica).

Para diseños relacionados (mismos sujetos)


→ ANOVA de medidas repetidas (mismos
sujetos en k condiciones) o Friedman (no
paramétrica).
Ejemplo 1.
Queremos comprobar si hay diferencias de género en la Emocionalidad (o Neuroticismo).
Con una muestra de 91 hombres y 263 mujeres a los que se les midió la Emocionalidad
mediante un test psicométrico, hemos obtenido los siguientes datos:

𝐻0 = µ𝐻𝑜𝑚𝑏𝑟𝑒𝑠 = µ𝑀𝑢𝑗𝑒𝑟𝑒𝑠
𝐻1 = µ𝐻𝑜𝑚𝑏𝑟𝑒𝑠 ≠ µ𝑀𝑢𝑗𝑒𝑟𝑒𝑠

Las variables del estudio son: Emocionalidad - VD (continua) y Género - VI (discreta con 2
grupos: Hombres y Mujeres). Por tanto el diseño del estudio es para grupos
independientes.

Antes de proceder con el análisis debemos comprobar los supuestos de normalidad e


igualdad de varianzas:
●​ Igualdad de varianzas: en este caso 𝑝 = 0. 55 , dado que 0. 55 > 0. 05 podemos
afirmar que las varianzas son iguales y se cumple el supuesto, podemos continuar
con el análisis.
Si 𝑝 > 0. 05 → Varianzas iguales.
●​ Supuesto de normalidad: en este caso 𝑝 = 0. 04 , dado que 0. 04 < 0. 05 no se
cumple el supuesto de normalidad.
Si 𝑝 < 0. 05 → NO hay normalidad
Si 𝑝 > 0. 05 → Normalidad

1.​ ¿Cuál es la conclusión sobre H0?


Dado que no se cumple el supuesto de normalidad debemos fijarnos en la fila de la
Prueba Mann-Whitney (no paramétrica), que compara la mediana de ambos grupos,
en este caso 𝑝 = 4. 36𝑒 − 3 = 0. 00436.
Dado que 0. 00436 < 0. 05, rechazamos la 𝐻0, y podemos afirmar que los grupos de
hombres y mujeres difieren significativamente en su
puntuación de emocionalidad.

También podemos llevar a cabo el contraste de hipótesis


mediante el intervalo de confianza. Debemos imaginar una
línea recta desde el extremo superior del intervalo de los
hombres que vaya hacia el extremo inferior del intervalo de
mujeres, si la línea recta corta el intervalo del otro grupo,
significa que se solapan, sino, no hay solapamiento.
En este caso habría solapamiento, aproximadamente en
2.9, en este caso mantendríamos la 𝐻0, pero el intervalo de
confianza es menos preciso que la prueba de Mann-Whitney, pudiendo no captar
diferencias pequeñas que son estadísticamente significativas.

2.​ ¿Cuál es el tamaño del efecto?


El tamaño del efecto para la Prueba de Mann-Whitney es de -0.20, por lo que
podemos concluir que existen diferencias leves entre los grupos. En este caso el
signo negativo nos indica que el primer grupo (1 - Hombres) es el que presenta una
menor emocionalidad.
Este tamaño del efecto explica porqué el intervalo de confianza no capta esta
diferencia leve entre grupos.

Interpretación del tamaño del efecto.

0.10 - 0.29 Efecto pequeño - diferencias leves.

0.30 - 0.49 Efecto mediano - diferencias


moderadas.

≥ 0.50 Efecto grande - diferencias grandes.

3.​ ¿Qué podemos concluir finalmente?


Los resultados muestran diferencias estadísticamente significativas en
emocionalidad entre hombres y mujeres (U de Mann-Whitney, p = 0.004).
Específicamente, las mujeres presentan mayor emocionalidad que los hombres,
aunque con un tamaño del efecto pequeño (r = -0.20). Esta diferencia, aunque
estadísticamente detectable, es de magnitud pequeña. La aparente discrepancia
entre los intervalos de confianza que se solapan y la significación estadística se
explica por la combinación de un efecto pequeño analizado con una muestra grande.
Ejemplo 2.
La orientación política está asociada a la autoestima feminista (“AE”, ej. “siento orgullo de
pertenecer al colectivo feminista”), pero no será igual entre hombres y mujeres cis.

Efecto de la orientación política:


𝐻0 = µ𝐶𝑜𝑛𝑠𝑒𝑟𝑣𝑎𝑑𝑜𝑟 = µ𝐿𝑖𝑏𝑒𝑟𝑎𝑙 = µ𝑃𝑟𝑜𝑔𝑟𝑒𝑠𝑖𝑠𝑡𝑎
𝐻1 = 𝐴𝑙 𝑚𝑒𝑛𝑜𝑠 𝑢𝑛𝑎 𝑚𝑒𝑑𝑖𝑎 𝑑𝑖𝑓𝑖𝑒𝑟𝑒

Efecto del género:


𝐻0 = µ𝐻𝑜𝑚𝑏𝑟𝑒𝑠 = µ𝑀𝑢𝑗𝑒𝑟𝑒𝑠
𝐻1 = µ𝐻𝑜𝑚𝑏𝑟𝑒𝑠 ≠ µ𝑀𝑢𝑗𝑒𝑟𝑒𝑠

Efecto de la interacción: Relación entre la orientación política y la AE difieren según el


género.
𝐻0 = 𝑁𝑜 ℎ𝑎𝑦 𝑖𝑛𝑡𝑒𝑟𝑎𝑐𝑐𝑖ó𝑛
𝐻1 = 𝐻𝑎𝑦 𝑖𝑛𝑡𝑒𝑟𝑎𝑐𝑐𝑖ó𝑛

Las variables del estudio son: Autoestima Feminista o AE - VD (continua), Orientación


política - VI (discreta con 3 categorías) y Género - VI (discreta con 2 categorías). Por tanto
el diseño del estudio es entre grupos, aplicando un ANOVA factorial.
No podemos comprobar los supuestos ya que no se proporcionan datos de normalidad,
homocedasticidad, independencia y nivel de medida.

Sobre el efecto de la política, (𝐹 = 708. 851; 𝑝 = 0. 001), dado que 0. 001 < 0. 05,
rechazamos la hipótesis nula, podemos afirmar que al menos una de las medias difiere de
2
manera estadísticamente significativa. Respecto al tamaño del efecto (η = 0. 590)
podemos decir que es un efecto grande, y que este factor explica un 59% de la varianza
total.
Interpretación del tamaño del efecto.

0.01 Efecto pequeño

0.06 Efecto mediano

0.14 Efecto grande

Sobre el efecto del género (𝐹 = 31. 980; 𝑝 = 0. 001), dado que 0. 001 < 0. 05, rechazamos
la hipótesis nula, y podemos afirmar que hay diferencias estadísticamente significativas
2
entre hombres y mujeres en AE. Respecto al tamaño del efecto (η = 0. 031), representa un
efecto pequeño explicando el 3.1% de la varianza total.

Sobre el efecto de la interacción (𝐹 = 10. 557; 𝑝 = 0. 001), dado que 0. 001 < 0. 05,
rechazamos la hipótesis nula, y podemos afirmar que existe una interacción entre los
factores y por tanto el efecto de la orientación política difiere según el género. Respecto al
2
tamaño del efecto (η = 0. 066), representa un tamaño del efecto moderado explicando el
6.6% de la varianza total.

Mediante los intervalos de confianza para el efecto de la interacción, podemos ver


exactamente qué orientación política presenta diferencias estadísticamente significativas
respecto al género en AE:

Dado que hay solapamiento en el grupo de


Conservadores (bajo en ambos) y de Progresistas
(alto en ambos), significa que los grupos de hombres
y mujeres con estas orientaciones políticas no
difieren en AE, mientras que los hombres y mujeres
con una orientación política Liberal sí difieren
significativamente en sus puntuaciones de AE
(mujeres > hombres).

También podría gustarte