CONCEPTOS TEÓRICOS
UNIDAD, ELEMENTO O MIEMBRO: cada uno de los individuos que es
sometido a estudio.
POBLACIÓN O UNIVERSO: conjunto total de individuos sobre el que estamos
interesados en obtener información. Normalmente es demasiado grande para
poder abordarla, resultando inviable.
2 tipos de población:
- Finita: cuando se cuenta con el número exacto de individuos que
pertenecen a esa población.
- Infinita: cuando el número exacto no puede ser listado físicamente.
MUESTRA: es una porción o subconjunto de la población y sobre el que
realmente se hacen las observaciones. Requisitos:
- Estar acotada en tiempo y espacio.
- Ser representativa: cada individuo debe reunir todas las características
que deseamos analizar.
TAMAÑO DE LA POBLACIÓN (N): cantidad de elementos que abarca la
población.
TAMAÑO DE LA MUESTRA (n): cantidad de elementos que abarca la
muestra.
VARIABLE: es una característica observable que varía entre los distintos
miembros de una población.
CONSTANTE: son características observables que no varían entre los distintos
miembros de una población. Las constantes son más frecuentes en
poblaciones pequeñas (homogeneidad). A mayor tamaño de la población
mayor variabilidad (heterogeneidad).
DATO: es un valor particular que asume una variable representado por un
número.
PARÁMETRO: es una cantidad numérica calculada sobre una población.
1
ESTADÍSTICO: es una cantidad numérica calculada sobre una muestra.
ESTIMADOR: un estadístico que sirve para aproximar a un parámetro.
TIPOS DE VARIABLES
Según la naturaleza de la variable:
CUALITATIVAS: representan atributos o cualidades. Sus valores no se pueden
asociar naturalmente a un número.
- Ordinales: si sus valores se pueden ordenar a través de una escala
jerárquica. Ejemplo: grado de dificultad de aprendizaje (leve, moderado,
elevado).
- Nominales: si sus valores no se pueden ordenar en una escala
jerárquica. Ejemplo: sexo, tipo de familia, barrio de procedencia.
- Dicotómicas: cuando hay dos opciones de nominación.
- Policotómicas: cuando hay más de dos opciones de nominación.
CUANTITATIVAS: sus valores representan cantidades que se asocian a un
número.
- Discretas: representan valores que se pueden contar y asociar a un
número entero. Asume valores prohibidos. Ejemplo: número de hijos o
hermanos, la edad representada en años.
- Continuas: representan valores incontables, pero que se pueden
medir. Ejemplo: el tiempo transcurrido en la escuela.
Según la relación que articula a las variables:
INDEPENDIENTES (X): en el eje horizontal. Son las características
manipulables que se suponen son la causa del fenómeno observado.
DEPENDIENTES (Y): en el eje vertical. Son los resultados medibles que
estamos interesados en analizar, dependen de las variables independientes.
2
INTERVINIENTES (Z): en el eje oblicuo. Son las características que afectan al
resultado modificando la relación causal de las variables X e Y.
TÉCNICAS DE SELECCIÓN Y RECOLECCIÓN DE DATOS
CENSO: listado de las características de los elementos de una población.
ENCUESTA: listado de las características de los elementos de una muestra.
MUESTREO
Técnica por la cual se obtiene una muestra. Hay 2 tipos:
- Probabilístico: brinda a todos los integrantes de una población la
misma oportunidad o posibilidad de ser seleccionados. Son confiables y
considerados de valor científico.
1) Aleatorio simple. Técnica por excelencia. Tabla Random de
números aleatorios conformados por columnas.
2) Estratificado. Cuando la población se divide en estratos de
diferentes tamaños. De cada estrato se selecciona una muestra
proporcional al tamaño del estrato.
3) Por conglomerado (Clusters). La población se divide en grupos.
De cada grupo se obtienen elementos y por último todos los
elementos seleccionados de cada grupo conforman la muestra.
4) Sistemático. Cuando los datos de la población están ordenados
en forma numérica. Se elige al azar entre los primeros elementos de
la población y las siguientes observaciones son elegidas guardando
la misma distancia entre sí.
- No probabilístico: no brinda a todos los integrantes de una población la
misma posibilidad de selección. Se basa en la conveniencia del
investigador. No son confiables y de poco valor científico.
Según la forma en que se presente la información hay 2 tipos de recolección:
RECOLECCIÓN SIMPLE O NO ORGANIZADA: cuando los datos se
presentan de manera primaria, tal y como fueron obtenidos durante el proceso
de observación.
3
RECOLECCIÓN ORGANIZADA O TABULACIÓN: se ordena la información
obtenida en tablas de distribuciones de frecuencia.
TABLAS DE FRECUENCIA
Exponen la información recogida en la muestra de manera inteligente,
agrupada en columnas de valores de variables y frecuencias. Hay 2 tipos:
- De datos no agrupados: cuando existen menos de 20 elementos en un
a muestra los datos son agrupados sin necesidad de formar clases o
categorías con ellos.
- Los datos están en bruto, o sea, sin clasificar.
- Se ordenan en una columna de manera individual.
- De datos agrupados: para muestras iguales o mayores a 20 unidades
se organizan los datos clasificándolos en clases, intervalos de datos
constituidos por un límite inferior y uno superior.
Elementos:
VALOR DE VARIABLE (Xi): son las variables calculadas.
FRECUENCIA ABSOLUTA (ni): es el número de veces que aparece un valor.
FRECUENCIA RELATIVA (fi): es el resultado de dividir la frecuencia absoluta
entre el número total de datos.
FRECUENCIA ACUMULADA ABSOLUTA Y RELATIVA (Ni / Fi): acumulan
las frecuencias absolutas y relativas. Es el resultado de sumar sucesivamente
las frecuencias absolutas o relativas.
FRECUENCIA PORCENTUAL (fi %): la frecuencia relativa multiplicada por
100.
TOTAL (N):
REPRESENTACIÓN GRÁFICA DE DATOS
4
Los datos se representan gráficamente a través de diagramas.
- Diagramas de barras: para variables cualitativas y cuantitativas
discretas.
- Histogramas: para variables cualitativas y cuantitativas continuas.
- Diagramas de sectores (gráficos de torta): para variables cualitativas.
- Polígonos de frecuencia: útil para resaltar distribuciones conjuntas o
analizar una clasificación cruzada entre una variable cualitativa y una
cuantitativa, o entre variables cuantitativas continuas y discretas.
- Pictogramas: para variables cualitativas.
- Integrales: unen dos o más tipos de diagramas.
MEDIDAS DE POSICIÓN O DE ORDEN
Miden CUANTILES: agrupaciones de datos en intervalos regulares.
CUARTILES: dividen los datos en 4 partes iguales.
DECILES: dividen los datos en 10 partes iguales.
PERCENTILES: dividen los datos en 100 partes iguales.
MEDIDAS DE CENTRALIZACIÓN
MEDIA: También conocida como valor promedio es el valor que se obtiene al
sumar todos los datos de un conjunto y luego dividir por la cantidad de datos
del conjunto.
MEDIANA: Es el valor central (equidistante) en un rango o conjunto de
valores. La mediana es el valor intermedio cuando un conjunto de datos se
ordena de menor a mayor, dejando un 50 % de los datos por debajo o menor
que ella y otro 50 % de los datos por encima o mayor que ella.
MODA: Es el valor con mayor frecuencia, o sea, el valor que aparece o se
repite más veces dentro de un conjunto de datos. Puede ser uno o más datos.
MEDIDAS DE FORMA
5
ASIMETRÍA O SESGO: una distribución es simétrica cuando ambas mitades
de la distribución (derecha e izquierda) son especularmente equivalentes,
coincidiendo media, mediana y moda en el punto medio de la distribución.
En tanto una distribución es asimétrica cuando el pico de la distribución se
concentra hacia uno de los lados, dejando en el otro una cola o sesgo. La
asimetría es positiva o negativa en función de qué lado se encuentra la cola de
la distribución: si está a la izquierda es una asimetría negativa; a la derecha es
una asimetría positiva. En la asimetría la media tiende a desplazarse hacia los
valores extremos; pero en general cualquier discrepancia entre las medidas de
centralización es indicador de asimetría.
APUNTAMIENTO O CURTOSIS (FISCHER): la curtosis indica el grado de
apuntamiento, o sea cuán pronunciada o aplastada está una curva de
distribución con respecto a la distribución normal o “de Gauss”. La campana de
Gauss es tomada como el modelo de distribución ideal donde la media, la
mediana y la moda coinciden en el pico central de la curva, la curva es
simétrica y a medida que nos alejamos de estos valores centrales la frecuencia
de aparición de los valores desciende.
A partir del coeficiente de curtosis se puede explicar la forma de la curva:
- Platicúrtica: la curtosis es <0 resultando en muy poca concentración de
datos en la media y una curva aplanada.
- Mesocúrtica: la curtosis es =0 resultando en una concentración de
datos en la media y resultando en una curva normal (simétrica).
- Leptocúrtica: la curtosis es >0 resultando que los datos se concentren
más arriba de la media y generando una curva muy pronunciada o
puntiaguda.
MEDIDAS DE VARIABILIDAD O DISPERSIÓN
RANGO: representa la diferencia entre el valor máximo y el valor mínimo en un
conjunto de datos.
VARIANZA: cuantifica la dispersión de los datos respecto a la media. Se
obtiene restando a cada dato la media y elevando el resultado al cuadrado.
DESVIACIÓN ESTÁNDAR: es el promedio de las desviaciones individuales.
Se obtiene mediante la raíz cuadrada de la varianza.
6
COEFICIENTE DE VARIACIÓN: describe la desviación estándar relativa a la
media, sirve para comparar la variación en las poblaciones.
CHI CUADRADA (PEARSON)
La prueba chi-cuadrado es una de las más conocidas y utilizadas para analizar
variables nominales o cualitativas, es decir, para determinar la existencia o no
de independencia entre dos variables. Que dos variables sean independientes
significa que no tienen relación, y que por lo tanto una no depende de la otra, ni
viceversa.
Así, con el estudio de la independencia, se origina también un método para
verificar si las frecuencias observadas en cada categoría son compatibles con
la independencia entre ambas variables.