CONCEPTOS BÁSICOS
DE ESTADÍSTICA APLICADA
Definición de estadística
Estadística es la ciencia y técnica
que tiene que ver con la
recolección, procesamiento,
análisis e interpretación de datos.
Clasificación de la estadística
Descriptiva
Estadística
Inferencial
ESTADÍSTICA DESCRIPTIVA
Incluye la tabulación, representación
y descripción de conjuntos de datos.
A partir de ellos se puede organizar,
simplificar y resumir información
básica.
Los datos pueden ser de variables
cuantitativas o cualitativas
ESTADÍSTICA INFERENCIAL
Proporciona métodos
para estimar las
características de un
grupo (población) Muestra
basándose en los datos Población
de un conjunto
pequeño (muestra).
Estadística en Medicina
El resultado de un análisis estadístico no
es un objetivo en sí mismo, sino una
herramienta para:
comprobar o rechazar una hipótesis
de trabajo,
representar de una forma eficiente y
resumida un colectivo de
observaciones,
para validar un modelo de un
proceso fisiológico
Datos cuantitativos
En el grupo de datos cuantitativos
tenemos
aquellos cuyo resultado puede variar
de forma continua, como puede ser
el peso, la presión arterial, el nivel de
colesterol, etc. y
los que sólo pueden tomar valores
enteros como por ejemplo el número
de hijos, el número de ingresados en
el Servicio de Ortopedia, un día
concreto, etc.
Datos cualitativos
Pueden ser:
nominales, que constituyen una simple etiqueta
como puede ser el sexo, el grupo sanguíneo, etc.
ordinales, en las que se da una relación de orden
entre las respuestas, por ej. resultado de una
patología/tratamiento (fallece, empeora, sin
cambios, mejora, curación).
CONCEPTOS BASICOS
POBLACION
Es el conjunto de todos los elementos que
presentan una característica común determinada,
observable y medible. Por ejemplo, si el elemento
es una persona, se puede estudiar las
características edad, peso, nacionalidad, sexo, etc.
MUESTRA
La mayoría de los estudios estadísticos, se realizan
no sobre la población, sino sobre un subconjunto
o una parte de ella, llamado muestra, partiendo
del supuesto de que este subconjunto presenta el
mismo comportamiento y característica.
MUESTREO
El proceso de muestreo implica:
Definir la población de interés:
Identificar el grupo objetivo sobre el cual se quiere obtener
información.
Diseñar la muestra:
Decidir qué tipo de muestreo se utilizará (aleatorio, no aleatorio,
etc.) y cuál será el tamaño de la muestra.
Seleccionar la muestra:
Extraer los elementos que conformarán la muestra de acuerdo al
diseño elegido.
Importancia del muestreo:
•Reducción de costos y tiempo: Permite obtener información
valiosa sin analizar toda la población.
•Mayor eficiencia: Facilita la recolección y análisis de datos.
•Generalización de resultados: Permite inferir conclusiones sobre
la población completa basándose en la muestra.
•Precisión: Un buen diseño muestral garantiza la
representatividad de la muestra y, por lo tanto, la precisión de las
conclusiones.
Tipos de muestreo:
•Muestreo probabilístico:
•Muestreo aleatorio simple: Cada elemento de la población tiene la
misma probabilidad de ser seleccionado.
•Muestreo aleatorio sistemático: Se selecciona un elemento al azar
y luego se eligen los siguientes a intervalos regulares.
•Muestreo estratificado: La población se divide en grupos (estratos)
y se selecciona una muestra aleatoria de cada estrato.
•Muestreo por conglomerados: La población se divide en grupos
(conglomerados) y se seleccionan aleatoriamente algunos grupos
para incluir todos sus elementos.
•Muestreo no probabilístico:
•Muestreo por cuotas: Se selecciona una muestra de acuerdo a
ciertas características de la población.
•Muestreo intencional o discrecional: El investigador selecciona los
elementos de la muestra basándose en su criterio.
Técnicas de muestreo
Cuando elegimos individuo de una población de estudio
para formar muestras podemos encontrarnos en las
siguientes situaciones:
Muestreos probabilistas
Conocemos la probabilidad de que un individuo sea elegido para
la muestra.
Interesantes para usar estadística matemática con ellos.
Muestreos no probabilistas
No se conoce la probabilidad.
Son muestreos que seguramente esconden sesgos.
En principio no se pueden extrapolar los resultados a la población.
A pesar de ello una buena parte de los estudios que se publican usan
esta técnica. ¡Buff!
En adelante vamos a tratar exclusivamente con muestreos
con la menor posibilidad de sesgo (probabilistas):
aleatorio simple, sistemático, estratificado y por grupos.
Muestreo aleatorio simple (m.a.s.)
Se eligen individuos de la población de estudio, de
manera que todos tienen la misma probabilidad de
aparecer, hasta alcanzar el tamaño muestral deseado.
Se puede realizar partiendo de listas de individuos de la
población, y eligiendo individuos aleatoriamente con un
ordenador.
Normalmente tiene un coste bastante alto su
aplicación.
En general, las técnicas de inferencia estadística
suponen que la muestra ha sido elegida usando m.a.s.,
aunque en realidad se use alguna de las que veremos a
continuación.
Muestreo sistemático
Se tiene una lista de los individuos de la población
de estudio. Si queremos una muestra de un
tamaño dado, elegimos individuos igualmente
espaciados de la lista, donde el primero ha sido
elegido al azar.
CUIDADO: Si en la lista existen periodicidades,
obtendremos una muestra sesgada.
Un caso real: Se eligió una de cada cinco casas para un
estudio de salud pública en una ciudad donde las casas se
distribuyen en manzanas de cinco casas. Salieron con
mucha frecuencia las de las esquinas, que reciben más sol,
están mejor ventiladas,…
Muestreo estratificado
Se aplica cuando sabemos que hay ciertos
factores (variables, subpoblaciones o estratos) que
pueden influir en el estudio y queremos asegurarnos
de tener cierta cantidad mínima de individuos de
cada tipo:
Hombres y mujeres,
Jovenes, adultos y ancianos…
Se realiza entonces una m.a.s. de los individuos de
cada uno de los estratos.
Al extrapolar los resultados a la población hay que
tener en cuenta el tamaño relativo del estrato con
respecto al total de la población.
Muestreo por grupos o conglomerados
Se aplica cuando es difícil tener una lista de todos los individuos
que forman parte de la población de estudio, pero sin embargo
sabemos que se encuentran agrupados naturalmente en grupos.
Se realiza eligiendo varios de esos grupos al azar, y ya elegidos
algunos podemos estudiar a todos los individuos de los grupos
elegidos o bien seguir aplicando dentro de ellos más muestreos
por grupos, por estratos, aleatorios simples,…
Para conocer la opinión de los médicos del sistema nacional de salud,
podemos elegir a varias regiones de España, dentro de ellas varias
comarcas, y dentro de ellas varios centros de salud, y…
Al igual que en el muestreo estratificado, al extrapolar los
resultados a la población hay que tener en cuenta el tamaño
relativo de unos grupos con respecto a otros.
Regiones con diferente población pueden tener probabilidades
diferentes de ser elegidas, comarcas, hospitales grandes frente a
pequeños,…
Ejemplo: Una muestra de n=100 individuos de una
población tiene media de peso 60 kg y desviación 5kg.
Dichas cantidades pueden considerarse como aproximaciones
(estimaciones puntuales)
60 kg estima a μ
5 kg estima a σ
5/raiz(n)= 0,5 estima el error estándar (típico) EE
Estas son las llamadas estimaciones puntuales: un número concreto
calculado sobre una muestra es aproximación de un parámetro.
Una estimación por intervalo de confianza es una que ofrece un
intervalo como respuesta. Además podemos asignarle una
probabilidad aproximada que mida nuestra confianza en la
respuesta:
Hay una confianza del 68% de que μ esté en 60±0,5
Hay una confianza del 95% de que μ esté en 60±1.
Ojo: He hecho un poco de trampa. ¿La ves?
Aplicación Al final del tema 2 dejamos
sin interpretar parte de los
resultados que obteníamos
Descriptivos para Número de hijos con SPSS.
Estadístico Error típ.
Media 1,90 ,045
Intervalo de Límite ¿Sabrías interpretar lo que
confianza para la inferior
1,81
falta por sombrear?
media al 95% Límite
s uperior 1,99
¿Puedes dar un intervalo de
Media recortada al 5%
confianza para la media al
68% de confianza?
1,75
Mediana 2,00
Varianza 3,114
Des v. típ. 1,765 Observa la asimetría.
Mínimo 0 ¿Crees probable que la
Máximo 8 asimetría en la población
Rango 8 pueda ser cero ya que la
Amplitud intercuartil obtenida en la muestra es
3,00 aprox. 1?
Asimetría 1,034 ,063
Curtos is 1,060 ,126
VARIABLE
Se llama variable a una característica que se observa
en una población o muestra y a la cual se desea
estudiar.
Tipos de Variables:
•Cualitativas (o Categóricas):
•Nominales: No tienen orden o jerarquía entre sus categorías (ej:
color del pelo, género).
•Ordinales: Tienen un orden o jerarquía entre sus categorías (ej:
nivel de educación, calificación en una escala).
•Cuantitativas (o Numéricas):
•Discretas: Pueden tomar solo valores enteros, sin valores
intermedios (ej: número de hijos, número de accidentes).
•Continuas: Pueden tomar cualquier valor dentro de un rango,
incluyendo decimales (ej: altura, temperatura, peso).
Ejemplos:
•Cualitativa Nominal: Género (masculino, femenino, otros).
•Cualitativa Ordinal: Escala de satisfacción (muy insatisfecho,
insatisfecho, neutral, satisfecho, muy satisfecho).
•Cuantitativa Discreta: Número de pacientes atendidos en un día.
•Cuantitativa Continua: Temperatura corporal.
INSTRUMENTOS DE RECOLECCION
DE DATOS
•Encuestas: Son instrumentos de recolección de datos que se utilizan para obtener
información de un grupo de personas. Pueden ser aplicadas de forma física o digital,
y permiten recopilar datos tanto cuantitativos como cualitativos.
•Entrevistas: Son técnicas de recolección de datos que permiten obtener
información más profunda y detallada de los participantes. Pueden ser
estructuradas o no estructuradas, y se utilizan para explorar temas en profundidad.
•Cuestionarios: Son herramientas que se utilizan para recopilar datos de forma
estructurada, a través de preguntas cerradas y de opción múltiple.
•Observaciones: Son técnicas de recolección de datos que permiten observar y
registrar el comportamiento de los participantes en su entorno natural. Pueden ser
directas o indirectas, y se utilizan para obtener información cualitativa.
•Pruebas: Son instrumentos de recolección de datos que se utilizan para medir el
conocimiento, las habilidades o las actitudes de los participantes.
•Otros métodos: Incluyen pruebas fisiológicas, revisión de registros existentes,
muestras biológicas y otros instrumentos específicos para la recopilación de datos.
Importancia de los instrumentos de recolección de datos
•Obtener información precisa: Los instrumentos de recolección de
datos permiten obtener información relevante y precisa para el
estudio.
•Analizar datos: Los datos recolectados con los instrumentos de
recolección de datos pueden ser analizados estadísticamente para
sacar conclusiones.
•Tomar decisiones: Los resultados de la recolección de datos
pueden ser utilizados para tomar decisiones informadas.
Selección de instrumentos:
La selección de los instrumentos de recolección de datos debe ser
cuidadosa y dependerá de los objetivos de la investigación, el tipo
de datos que se buscan y la población objetivo.
TABULACION DE DATOS
La tabulación de datos en estadística básica consiste en organizar y
presentar datos en tablas para facilitar la comprensión y análisis de
la información. Se utiliza una tabla de frecuencias para clasificar y
resumir los datos, mostrando cada valor y la frecuencia con la que
aparece.
El proceso de tabulación de datos
Recopilación de datos: Se recolectan los datos a través de diversas
fuentes, como encuestas, experimentos, o registros existentes.
Organización: Se clasifican los datos en categorías o intervalos,
dependiendo de si son cualitativos o cuantitativos.
Creación de la tabla de frecuencias: Se crea una tabla donde se
listan los valores de cada categoría o intervalo y se indica la
frecuencia con la que cada valor aparece.
Presentación: La tabla se presenta de forma clara y ordenada, con
títulos y etiquetas que faciliten la lectura e interpretación.
TABULACION DE DATOS
Tipos de tablas de frecuencias
•Tabla de frecuencias para datos no agrupados: Se utiliza cuando se
tienen pocos datos y se pueden registrar todos los valore.
•Tabla de frecuencias para datos agrupados: Se utiliza cuando se
tienen muchos datos y se agrupan en intervalos para facilitar la
presentación.
•Tabla de frecuencias con frecuencias relativas: Se utilizan para
expresar la frecuencia de cada valor como un porcentaje del total de
datos.
Beneficios de la tabulación
•Facilita la identificación de patrones y tendencias en los datos.
•Ayuda a comparar diferentes grupos o categorías de datos.
•Permite una mejor comunicación de los resultados de la
investigación.
•Es una herramienta fundamental para el análisis estadístico.
Presentación
de datos
Presentación de datos
cuantitativos
Indicar un valor central y uno de variabilidad o
dispersión.
Cuando es razonable suponer que los datos pueden
seguir una distribución normal, se estimará la media y
la desviación estándar.
Ejemplo: La media de la PAS fue de 139.2 ± 14.9
mmHg
MEDIDAS DE TENDENCIA CENTRAL
Las medidas de tendencia central en estadística son herramientas para resumir un
conjunto de datos en un valor representativo que indica el centro de la distribució[Link]
más comunes son la media, la mediana y la moda.
•Media (o promedio): Es el resultado de sumar todos los valores de un conjunto de datos
y dividir el resultado por el número total de datos. Por ejemplo, si tienes los números 2, 4,
6, 8, 10, la media sería (2+4+6+8+10)/5 = 6.
•Mediana: Es el valor central de un conjunto de datos cuando están ordenados de menor
a mayor. Si hay un número impar de datos, la mediana es el dato central. Si hay un
número par de datos, la mediana es el promedio de los dos datos centrales. Por ejemplo,
si los datos son 2, 4, 6, 8, 10, la mediana es 6. Si los datos son 2, 4, 6, 8, la mediana es
(4+6)/2 = 5.
Moda: Es el valor que más se repite en un conjunto de datos. Por ejemplo, si los datos son
2, 2, 3, 4, 5, 5, 5, 6, la moda es 5.
Usos: Las medidas de tendencia central ayudan a comprender la distribución de los datos,
identificar el valor típico o promedio, y facilitar la comparación entre diferentes conjuntos
de datos.
Mediana
es un valor del conjunto de datos
que mide el elemento central: La
mitad de los elementos se
encuentran por arriba y la otra
mitad por debajo de él.
Distribución Sesgada a la Derecha
30
Moda
Mediana
25
20
Media
15
10
0
1 2 3 4 5 6 7 8 9 10 11 12 13
Distribución Sesgada a la Izquierda
30
25
Moda
Mediana
20
Media
15
10
0
1 2 3 4 5 6 7 8 9 10 11 12 13
Distribución Simétrica
90
80 Moda
70 Mediana
60
Media
50
40
30
20
10
0
1 2 3 4 5 6 7 8 9 10 11 12 13
Moda
es el valor que se repite más dentro de un
conjunto de datos.
Media, mediana y moda
• La media, la mediana y la moda son
idénticas en una distribución simétrica
• La mediana puede ser la idónea en
distribuciones sesgadas, ya que no se afecta
tanto por valores extremos.
• Sin embargo no se cuenta con un criterio
único para aplicar alguna de las tres
medidas
CUARTILES
Los cuartiles dividen en cuatro partes las
observaciones. El primer cuartil Q1 es un valor
que deje por debajo de él 25% de las y por
encima 75% de las observaciones. El Q2 es la
mediana (50%) y Q3 deja por debajo 75% y
por encima 25% de las observaciones
CUARTILES
75% 25%
25% 75%
25% 25% 25% 25%
Cuartil 1 MedianaCu Cuartil 3 Máximo
Mínimo
Q1 artil 2 Q2 Q3
PERCENTILES
Los percentiles dividen en dos partes las
observaciones. Por ejemplo, el percentil 20,
P20, es el valor que deja por debajo un 20%
y por encima un 80% de las observaciones
PERCENTILES
20% 80%
Mínimo Percentil 20 Máximo
P20
Presentación de datos
cualitativos
Los datos cualitativos (nominales u
ordinales) se cuantifican como
recuentos del número de casos
observados para cada categoría, y
suelen expresarse habitualmente
como porcentajes u otro tipo de
cocientes.
Ej. La proporción de mujeres con
síndrome X es del 82 % (55 de 67)
MEDIDAS DE VARIABILIDAD
Las medidas de variabilidad, también conocidas como medidas de dispersión, son
herramientas estadísticas que cuantifican la dispersión o extensión de un conjunto de
datos. Indican qué tan similares o diferentes son los valores entre sí, ayudando a
comprender la heterogeneidad o homogeneidad de los datos.
•Rango (Range): La diferencia entre el valor máximo y el mínimo de un conjunto de
datos. Es fácil de calcular, pero puede verse afectada por valores extremos.
•Desviación estándar: La medida más común de variabilidad. Indica la dispersión
promedio de los datos alrededor de la media.
•Varianza: El cuadrado de la desviación estándar. Expresa la variabilidad de una
distribución en unidades cuadradas.
•Rango intercuartil (RIC): El rango de la mitad central de los datos (la diferencia entre
el tercer y primer cuartil).
Distribución normal:
distribución aproximada de
valores
Distribución normal: curva simétrica
30
25
20
15
10
0
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17
Asimetría a la izquierda
30
25
20
15
10
0
1 2 3 4 5 6 7 8 9 10 11 12 13
Asimetría a la derecha
30
25
20
15
10
0
1 2 3 4 5 6 7 8 9 10 11 12 13
Medidas de Variabilidad
50
45
40
35
30
25
20
15
10
5
0
1 3 5 7 9 11 13 15 17 19 21 23
Coeficiente de variación
El CV es igual al cociente entre la
desviación típica y la media
Si encontramos que el coeficiente de
variación es próximo o mayor que 0.5
y no puede haber datos negativos, la
distribución no es normal
Ej.: triglicéridos en pacientes
diabéticos
Por tanto el coeficiente de variación es 0.49.
Gráficos
Son imágenes que, combinando la
utilización de sombreado, colores,
puntos, líneas, símbolos, números,
texto y un sistema de referencia
(coordenadas), permiten presentar
información cuantitativa.
Gráficas
Sirven para:
Organizar los datos
Observar patrones
Observar agrupamientos
Observar relaciones
Comparar distribuciones
Visualizar rápidamente la distribución de
los datos
Visualizar, obtener y comparar medidas
estadísticas
Gráficas
La calidad de un gráfico estadístico consiste en
comunicar ideas complejas con precisión,
claridad y eficiencia, de tal manera que:
• Induzca a pensar en el contenido más que
en la apariencia
• No distorsione la información proporcionada
por los datos
• Presente mucha información (números) en
poco espacio
• Favorezca la comparación de diferentes
grupos de datos o de relaciones entre los
mismos (por ejemplo una secuencia
temporal)
EJES CARTESIANOS
En gráficos estadísticos, los ejes son líneas que delimitan el área donde se representan los
datos. Los ejes horizontal (eje X) y vertical (eje Y) son comunes en gráficos cartesianos y
permiten ubicar puntos, barras o líneas que representan la información.
Eje X (Horizontal):
•Generalmente representa las categorías o variables independientes.
•Puede incluir nombres, etiquetas o valores numéricos.
•En gráficos de barras, el eje X muestra las categorías que se están comparando.
•En gráficos de dispersión, el eje X representa la variable independiente.
Eje Y (Vertical):
•Representa los valores o variables dependientes.
•Puede mostrar frecuencias, medidas o cualquier valor numérico.
•En gráficos de barras, la altura de cada barra representa el valor en el eje Y.
•En gráficos de dispersión, el eje Y representa la variable dependiente.
Importancia de los Ejes:
•Proporcionan un marco de referencia para la interpretación de los datos.
•Permiten comparar valores entre diferentes categorías o variables.
•Ayudan a identificar tendencias, patrones y relaciones entre los datos.
•Facilitan la lectura y comprensión del gráfico por parte del usuario.
Diagrama de barras
Grafica de barras
40
35
30
Frecuencia
25
20
15
10
5
0
Mes
(variable discreta o categoría)
Histograma
Histograma
40
Frecuencia de la clase
35
30
25
20
15
10
5
0
Clases
(variable continua agrupada en clases o
intervalos)
Diagrama de Pastel
Partes del todo
17%
29%
Opcion 1
Opcion 2
Opcion 3
22% Opcion 4
Opcion 5
13%
19%
Diagrama de puntos
Media de los resultados del cuestionario de calidad de vida
Hombres = rojo Mujeres = amarillo
Diagrama de Caja y
Bigotes
Min Max
Q1 mediana Q3
Escala
Recomendaciones para
un gráfico
Si es estético, fomenta la lectura y
comprensión.
Sencillez y claridad, el uso del color debe
ser moderado y bien elegido.
Usar líneas finas, eliminar las superfluas
Usar grid si es necesario
Balance entre el espacio en blanco y
datos
Idealmente no hay que acudir al texto .
Balance entre texto, tablas e imágenes,
Combinar texto y tablas insertas
EJEMPLO
Análisis de datos demográficos, económicos, sociales y de salud en un
grupo de estudiantes
Objetivos:
•Recopilar y organizar datos reales del grupo.
•Aplicar conceptos de estadística descriptiva: tablas de frecuencia,
gráficos, medidas de tendencia central y dispersión.
•Interpretar los resultados y comunicar hallazgos de forma clara.
Población: Curso de alumnos TECNICATURA EN HEMOTERAPIA
Actividades
[Link]ón de instrumento y recolección de datos
[Link]ón de la información
[Link]ón de los datos
4.Cálculo de medidas estadísticas
[Link]ón y conclusiones
[Link] final (individual o grupal)