UNIVERSIDAD SERGIO
ARBOLEDA
Análisis de Datos
Nivel Explorador
MASTERCLASS I
REPASO CONCEPTOS VISTOS
De acuerdo con lo que hemos visto en estas semanas…
¿Qué es la analítica de datos?
¿En qué sectores es importante y se puede aplicar la analítica de datos?
¿Creen que la analítica de datos tiene algún impacto en el mundo actual? ¿Por qué?
¿Qué fuentes de datos podemos tener al realizar una investigación?
¿Cuáles son los pasos o fases para realizar una buena limpieza de datos?
¿Qué es la moda?
¿Qué es la media?
¿Qué es la mediana?
¿Cuál es la diferencia entre media, moda y mediana?
¿Qué necesitamos para realizar un histograma?
¿Qué pasos debemos seguir para hacer un diagrama de tallo y hojas?
RANGO Y DESVIACIÓN ESTÁNDAR
Rango: Es la diferencia entre el valor máximo y mínimo en un conjunto de datos
Aplicación:
Cuantifica la Variabilidad: El rango proporciona una medida simple de la variabilidad en los datos. Un rango más
amplio indica una mayor dispersión.
Fórmula:
Rango=Valor_Maˊximo−Valor_Mıˊnimo
Ejemplo:
Si tienes el conjunto de datos {10,15,20,25,30}{10,15,20,25,30}, el rango sería 30−10=2030−10=20.
Desviación Estándar: Es una medida que indica cuánto se desvían los valores individuales de la media en un conjunto
de datos.
RANGO Y DESVIACIÓN ESTÁNDAR
Rango: Es la diferencia entre el valor máximo y mínimo en un conjunto de datos
Aplicación:
Cuantifica la Variabilidad: El rango proporciona una medida simple de la variabilidad en los datos. Un rango más
amplio indica una mayor dispersión.
Fórmula:
Rango=Valor_Maˊximo−Valor_Mıˊnimo
Ejemplo:
Si tienes el conjunto de datos {10,15,20,25,30}{10,15,20,25,30}, el rango sería 30−10=2030−10=20.
Desviación Estándar: Es una medida que indica cuánto se desvían los valores individuales de la media en un conjunto
de datos.
RANGO Y DESVIACIÓN ESTÁNDAR
Aplicación:
Cuantifica la Dispersión Promedio: Mientras mayor sea la desviación estándar, mayor será la dispersión de los
datos en relación con la media.
RANGO Y DESVIACIÓN ESTÁNDAR
Ejemplo:
Comparación:
Rango vs. Desviación Estándar:
El rango proporciona una medida de dispersión extremadamente simple y fácil de entender, pero es sensible a
valores atípicos.
La desviación estándar es más robusta ya que utiliza todos los valores y penaliza los extremos de manera más
equitativa.
RANGO Y DESVIACIÓN ESTÁNDAR
Importancia en el Análisis de Datos:
Entendimiento de la Variabilidad: Estas medidas son esenciales para comprender cuán dispersos o concentrados
están los datos alrededor de la media.
Identificación de Outliers: Ayudan a identificar valores atípicos que podrían afectar la interpretación de los datos.
Evaluación de la Fiabilidad: La desviación estándar, en particular, es fundamental para evaluar la fiabilidad de los
datos en torno a la media.
Consejo Práctico: Utiliza la desviación estándar cuando busques una medida más robusta de la dispersión que no se
vea fuertemente afectada por valores extremos.
RANGO Y DESVIACIÓN ESTÁNDAR
EXCEL
Para realizar los cálculos en Excel por fórmula sería así:
Rango: Se usa las funciones MAX() y MIN() dentro de () va el rango donde están los datos
Desviación Estándar: Se usan las funciones STDEV para una muestra o STDEVP para la población.
Otra opción es mediante menú, ingresando a Datos Análisis de Datos
RANGO Y DESVIACIÓN ESTÁNDAR
Si no te aparece esa opción debes hacer lo siguiente:
Clic derecho sobre la barra de navegación
RANGO Y DESVIACIÓN ESTÁNDAR
RANGO Y DESVIACIÓN ESTÁNDAR
Al dar clic en Ir, se abre la siguiente ventana:
RANGO Y DESVIACIÓN ESTÁNDAR
Al hacer clic en Aceptar se puede visualizar la opción
RANGO Y DESVIACIÓN ESTÁNDAR
Al navegar por esa opción podemos ver varias opciones de cálculos estadísticos
VARIANZA
La varianza es una medida estadística que cuantifica la dispersión de un conjunto de datos. Es la media aritmética de
las diferencias al cuadrado entre cada dato y la media del conjunto. La varianza se representa comúnmente por para
una muestra y para la población.
Relación con la Desviación Estándar:
La desviación estándar (s para una muestra y σ para la población) es simplemente la raíz cuadrada de la varianza. Es
decir, la desviación estándar es la medida de dispersión original (varianza) pero expresada en las mismas unidades
que los datos.
VARIANZA
VARIANZA
• Esto quiere decir que una varianza grande indica que los datos están dispersos, mientras que una varianza
pequeña sugiere que los datos están agrupados cerca de la media.
• La desviación estándar proporciona una medida más fácil de interpretar, ya que está en la misma escala que los
datos originales.
EXCEL
Las fórmulas para la varianza son STDEV.S y STDEV.P para una muestra y una población respectivamente o mediante
la opción Datos Análisis de Datos se puede generar para los dato seleccionados.
COEFICIENTE DE VARIACIÓN
El coeficiente de variación (CV) es una medida estadística que proporciona una perspectiva relativa de la variabilidad
en un conjunto de datos. Su objetivo es expresar la desviación estándar como un porcentaje de la media, permitiendo
comparar la dispersión relativa entre conjuntos de datos con escalas diferentes.
El CV es más útil cuando se comparan conjuntos de datos que tienen escalas y unidades diferentes.
No se puede utilizar cuando la media es cercana a cero, ya que puede llevar a divisiones por cero o resultados
ilógicos.
El Coeficiente de Variación es una herramienta valiosa para entender la dispersión relativa de los datos y es
especialmente útil cuando se comparan conjuntos de datos heterogéneos.
El CV se calcula utilizando la fórmula:
COEFICIENTE DE VARIACIÓN
Un coeficiente de variación pequeño indica que la desviación estándar es pequeña en relación con la media. Los
datos tienden a estar más concentrados alrededor de la media.
Un coeficiente de variación grande sugiere que la desviación estándar es grande en comparación con la media. Los
datos están más dispersos alrededor de la media.
Uso y Ventajas:
1. Comparación Relativa: Permite comparar la variabilidad entre conjuntos de datos con unidades y escalas
diferentes.
2. Estandarización: Facilita la comparación de la dispersión de datos en contextos diversos.
3. Interpretación Intuitiva: Al expresarse como porcentaje, es fácil de entender y comunicar.
COEFICIENTE DE VARIACIÓN
EXCEL:
Se puede calcular directamente por la opción: Datos Análisis de Datos, seleccionando la opción coeficiente de
variación. Por formula se usaría asi:
Asumiendo que tenemos datos en la columna A desde la fila 2 hasta la 100
STDEV.S(A2:A100) / PROMEDIO (A2:A100)*100
Ejemplo:
CORRELACIÓN
Es una medida estadística que describe la relación cuantitativa entre dos variables. Indica cómo cambian juntas, es decir, si hay una
relación lineal entre ellas. El coeficiente de correlación cuantifica la fuerza y la dirección de esta relación.
Coeficiente de Correlación:
El coeficiente de correlación más común es el coeficiente de correlación de Pearson (r), que varía entre -1 y 1.
r=1: Correlación perfecta positiva.
r=−1: Correlación perfecta negativa.
r=0: Ausencia de correlación lineal.
Interpretación de Coeficientes de Correlación:
1. Correlación Positiva: 0<r<1:
Cuanto más cerca de 1, más fuerte es la relación positiva.
Indica que a medida que una variable aumenta, la otra tiende a aumentar.
CORRELACIÓN
2. Correlación Negativa: −1<r<0:
Cuanto más cerca de -1, más fuerte es la relación negativa.
Indica que a medida que una variable aumenta, la otra tiende a disminuir.
3. Ausencia de Correlación: r≈0:
No hay relación lineal aparente entre las variables.
No implica necesariamente independencia total, ya que puede haber relaciones no lineales.
CORRELACIÓN
Ejemplos Prácticos:
1. Correlación Positiva:
r=0.8: Existe una fuerte correlación positiva.
Interpretación: A medida que la variable X aumenta, la variable Y tiende a aumentar.
2. Correlación Negativa:
r=−0.6: Existe una correlación negativa moderada.
Interpretación: A medida que la variable X aumenta, la variable Y tiende a disminuir.
3. Ausencia de Correlación:
r=0.1: La correlación es débil y cercana a cero.
Interpretación: No hay una relación lineal fuerte entre las variables X e Y.
CORRELACIÓN
Ejemplos Prácticos:
1. Correlación Positiva:
r=0.8: Existe una fuerte correlación positiva.
Interpretación: A medida que la variable X aumenta, la variable Y tiende a aumentar.
2. Correlación Negativa:
r=−0.6: Existe una correlación negativa moderada.
Interpretación: A medida que la variable X aumenta, la variable Y tiende a disminuir.
3. Ausencia de Correlación:
r=0.1: La correlación es débil y cercana a cero.
Interpretación: No hay una relación lineal fuerte entre las variables X e Y.
CORRELACIÓN
Limitaciones y Consideraciones:
Correlación no implica Causalidad: Una correlación fuerte no significa necesariamente que un cambio en una
variable cause un cambio en la otra.
Sensibilidad a Outliers: Los valores atípicos pueden afectar significativamente el coeficiente de correlación.
EXCEL
En Excel, se puede calcular utilizando la función PEARSON. O directamente desde el menú Datos Análisis de
datos.
EJERCICIOS PROPUESTOS POR
ESTUDIANTES
¿Preguntas?