0% encontró este documento útil (0 votos)
2 vistas24 páginas

Introducción al Análisis de Datos Estadísticos

El Módulo 1 del curso se enfoca en el Análisis Exploratorio de Datos, destacando la importancia de los conceptos fundamentales en estadística para realizar análisis adecuados y tomar decisiones informadas. Se introducen conceptos clave como estadísticos, población, características cualitativas y cuantitativas, y se explican las medidas de tendencia central, como media, mediana y moda, así como la clasificación de variables. Además, se discuten métodos para recolectar y organizar datos, y se presenta la utilidad de las tablas de distribución de frecuencias para facilitar el análisis.

Cargado por

Andres Cifuentes
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas24 páginas

Introducción al Análisis de Datos Estadísticos

El Módulo 1 del curso se enfoca en el Análisis Exploratorio de Datos, destacando la importancia de los conceptos fundamentales en estadística para realizar análisis adecuados y tomar decisiones informadas. Se introducen conceptos clave como estadísticos, población, características cualitativas y cuantitativas, y se explican las medidas de tendencia central, como media, mediana y moda, así como la clasificación de variables. Además, se discuten métodos para recolectar y organizar datos, y se presenta la utilidad de las tablas de distribución de frecuencias para facilitar el análisis.

Cargado por

Andres Cifuentes
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

Modulo 1

La primera unidad de este curso vamos a trabajar lo que es Análisis Exploratorio de


Datos.

Básicamente como calcular los estadísticos descriptivos, pero previo a esto es necesario

conocer algunos conceptos fundamentales, yo he visto personas que pueden hacer


cálculos

muy sofisticados estadísticos.

Sin embargo, podemos nosotros ver que por no tener algunos conceptos básicos claros

a veces, utilizan mal las herramientas que se necesitan aplicar.

La estadística lo que hace es que reduce la información y la transforma en valores

de interés que nos permitan analizar, pero sobre todos concluir, pero sobre todo decidir.

Por allí alguien decía que quien tiene la información tiene el poder, es parcialmente

cierto, porque tiene el poder si esa información la analiza, si de esa información saca
conclusiones

y eso le va a ayudar para tomar decisiones adecuadas.

Conozco información que tienen información, pero a la larga, la información digamos no

la utilizan adecuadamente.

Entonces la estadística da normas para procesos como la recolección, la organización, el

análisis, la interpretación de los datos para tomar decisiones adecuadas.

Cuando nosotros tenemos datos que se van sacando de una población en particular a eso
nosotros

le vamos a llamar estadísticos, quizás ustedes han visto por ejemplo las estadísticas de

los jugadores.

Por ejemplo, los jugadores de beisbol, de futbol, la cantidad de estadísticos que le

van calculando.

Tenemos también otro término que es importante y es el término población, para que
alguien

pertenezca a una población, tiene que tener una característica común verdad, por ejemplo,
nosotros podríamos hablar en un salón de clase por ejemplo.

Las personas que usan lentes, por ejemplo, ellos pueden formar una población que es

distinta a la misma población de la clase.

Aun cuando la persona tenga lentes de contacto, pero si tiene lentes, forma parte de esa
población,

aunque no se lo miremos físicamente.

Ahora si los datos son a partir de una muestra le vamos a llamar estadísticos, si son a
partir

de una población nosotros le vamos a llamar parámetros.

Y tenemos que la parte que distingue el elemento de la población nosotros le vamos a


llamar

característica.

La característica es el signo distintivo entonces para la población, debemos de tener

claro que esa característica puede ser de tipo Cualitativo o puede ser de tipo Cuantitativo

verdad, cuando hablamos nosotros de algo cualitativo, es porque no tiene grados de


comparación

verdad, nosotros podríamos hablar por ejemplo del sexo verdad, si hablamos de hombre o
mujer,

no hay grados de comparación.

Una mujer no puede decir que es mejor que el hombre, pero tampoco el hombre puede
decir

que es mejor que una mujer, porque cada quien tiene sus propios atributos, cada quien
tiene

una forma muy particular de ser.

Entonces allí no hay grados de comparación, allí estamos hablando de algo cualitativo,

los grupos se llaman modalidades, por ejemplo, el sabor verdad, alguien puede decir
miren

a mí me gusta más lo dulce, eso no quiere decir que lo dulce sea mejor que el salado.

Lo dulce es dulce y lo salado es salado es más el atributo puede tener variabilidad,


pero no hay nada correcto en decir esto es mejor que lo otro.

Mientras que una variable es así, esa permite grados de comparación, y entonces lo
importante

aquí que es una característica cuantitativa, verdad y los grupos que se forman son clases,

por ejemplo yo podría en un momento dado decir, el día de hoy si tuve un desayuno

muy abundante por ejemplo y que pesó 190.75 libras, o sea que subí, 0.75 el día, el

día de hoy.

Por ejemplo, entonces allí si hay grados de comparación, nosotros nos imaginamos
digamos

cuando alguien dice por ejemplo, yo no les podría decir yo peso 100 libras, nadie me

lo va a creer, ahora ¿por qué?

al verme mi cuerpo hay un sentido de comparación y eso sucede con las variables
cuantitativas.

Ahora hay variables cuantitativas de 2 tipos, de 2 clases, tenemos las variables


cuantitativas

discretas, que no permiten división o fraccionamiento, verdad, generalmente son números


enteros,

y luego tenemos las variables continuas que esas si permiten división o fraccionamiento,

en el caso de las discretas yo podría decir miren fíjense que yo tengo 2 hijos, una mi

cuñada por ejemplo tiene 1 hijo, alguien podría hablar de 4 hijos.

Pero nadie puede decir miren yo tengo 0.10 hijos eso no es posible decirlo, porque es

una variable de tipo discreta.

Nosotros hablamos por ejemplo de los latidos del corazón las pulsaciones esas son
discretas,

mientras que las variables continuas esas si permiten división o fraccionamiento.

Por ejemplo, el peso, la estatura, esas son variable de tipo continuo, pueden tener los

decimales que sean verdad.

Y en ese caso digamos es correcto hablar por ejemplo de una estatura hasta digamos
además
de metros, centímetros, milímetros, verdad no hay ningún problema porque tenemos una
continuidad.

Así es que digamos las características pueden ser de 3 tipos, los atributos que son
cualitativos, 2.

Cuantitativos donde tenemos las variables discretas y las variables continuas.

¿ahora por qué hacemos esta diferenciación?

porque dependiendo del tipo de variable que nosotros utilicemos, si va a hacer el tipo

de cálculos o el tipo de herramienta estadística que nosotros vamos a utilizar, al final la

estadística debe ser bien utilizada.

Me ha llamado la atención por ejemplo este autor de apellido Triola que escribe el libro

de estadística y el decía que no hay que utilizar la estadística como un borracho

lo utiliza como un poste de alumbrado público a las 2 de la mañana.

Un borracho digamos que viene a las 2 de la mañana allí cascabiando como decimos en

Guatemala, va utilizar el poste del alumbrado público para apoyarse, en la estadística no


es eso.

La estadística debe utilizarse para lo que verdaderamente sirve, el poste del alumbrado

público para alumbrarnos, para darnos luz sobre los datos y que nosotros podamos tomar

decisiones adecuadas.

Muy bien, vamos a principiar con lo que es recolectando datos, nosotros podríamos por

ejemplo tener una cantidad muy grande de datos y por aquí empieza el resumen de la
estadística,

por ejemplo, aquí tenemos cantidades de electrodomésticos vendidos semanalmente


durante 100 semanas.

Si yo les pregunto a ustedes cual es el, digamos la semana donde se vendió más, va a
costar

un poco ubicarnos verdad, por allí tenemos el dato, lo van a ubicar más adelante que

es 88 y luego podríamos preguntarnos quien es el que vende menos y entonces al estar

observando acá, vamos a observar que el que vende menos es 21, la semana donde se
vendió menos.
Pero no es fácil a primera vista encontrarlo y entonces allí es donde empezamos la
estadística,

simplemente ordenando los datos de menor a mayor o de mayor a menor.

Nosotros podríamos formar lo que se le conoce como una serie y vean allí ya los datos
ordenados

en Excel, simplemente colocan sus datos en una columna, le dan van al utilitario de datos,

le dicen ordenar de menor a mayor, automáticamente les va a ordenar todos los datos.

Anteriormente esto nos llevaba una cantidad de tiempo ordenando los datos, observen acá

allí es más fácil, la semana donde más se vendió fue 88, la semana donde menos se
vendió fue 21.

Hay que ir a ver cuál es esa semana, los datos del centro, andan por alrededor de 55

verdad, entonces ya teniendo las series nosotros podemos un ordenamiento muy rápido
de los datos.

Luego es conveniente formar clases, con esto formamos lo que se llama una tabla de
distribución

de frecuencias, a través de la fórmula de Sturges es muy utilizada, en donde vamos a

tener el rango recorrido dividido 1 + 3.322 log n.

En los datos anteriores nosotros restamos 88-21 + 1, para incluir el extremo del lado

izquierdo nosotros tendríamos que el recorrido total es de 68 dividido 1+3.322log de base

10 de 100 porque en este caso tenemos 100 datos.

Nos da 8.9, podemos aproximar allí a 9, como dato más correcto, así que le damos 9 al

tamaño de la clase, digamos que por ejemplo en la primera clase arrancamos con el dato

menor que es 21, incluyendo el valor de la izquierda 21, 22, 23, 24,25, 26, 27, 28, y

tendríamos 29, entonces nosotros tenemos allí prácticamente una amplitud de 9.

Si vamos a ver la serie los datos tendríamos que entre 21-29 hay prácticamente 4 datos,

esa es la frecuencia que está reflejada acá, luego de 30 a 38, nosotros observamos la
serie

estando ordenados y allí si empezamos a contar del 32, 33 hasta adelante tendríamos 12
antes de llegar al 38.
Así que teniendo ya nuestra conformación en clases nos ayuda para tomar decisiones

más adecuadas, vemos que hay 23 semanas, en donde lo que se está vendiendo es entre

48 a 56 electrodomésticos, habría que observar esas semanas porque allí está la mayoría,

pero podríamos ir a observar las 3 últimas que es donde se está vendiendo más.

Probablemente allí está la semana de Navidad o en un momento dado, digamos un


mundial,

digamos en el mes de junio como otra semana buena.

Y eso es donde se está vendiendo más electrodomésticos y podríamos ver que las
semanas más bajas

probablemente que se yo podría ser enero y febrero y otro par de semanas allí.

Y esto nos va a ayudar a tomar decisiones en los negocios, observar donde está la
mayoría

de datos, porque allí es donde se está vendiendo de una forma regular, podríamos
observar

donde hay venta de más electrodomésticos, donde hay venta de menos


electrodomésticos.

Muy bien, a continuación podríamos calcular una serie de medidas descriptivas y hay de 4

formas, en próximos videos nosotros vamos a mostrar información y los conceptos básicos

de estas medidas, las de tendencia central, las de dispersión, las de posición y las de
forma

que lo vamos a calcular en Excel con la herramienta de análisis de datos.

En esta segunda parte nosotros vamos a conocer los estadísticos principales que nosotros

podemos calcular en una cantidad de datos, vamos a tener 4 grandes grupos estadísticos

que nosotros podemos calcular.

Entre ellos tenemos los de tendencia central lo que buscan es el centro de la distribución,

luego si queremos posicionarnos en algún punto particular de la distribución nosotros


podemos calcular los cuantiles.

Tenemos también que, si queremos ver la dispersión de los datos, para ello se calculan
otro tipo

de estadísticos que se conoce como medidas de variación.

Y luego si queremos conocer la forma de la distribución, tanto en el sentido horizontal,

como el sentido vertical, podemos calcular las medidas de forma.

Iniciaremos con las medidas de tendencia central, en cuanto a las medidas de tendencia
central

las más comunes, ustedes las han escuchado son la Media, Moda, Mediana, aunque
también

existen otras pocas conocidas como el Eje intercuartílico, Intervalo medio.

Cuando nosotros tenemos una distribución y queremos ver una cantidad de datos,
generalmente

los datos los podemos poner sobre un eje de coordenadas en donde el eje x, nosotros
vamos

a colocar la variable de interés y en el eje de la y, vamos a colocar la frecuencia

o la cantidad de datos.

Generalmente en este tipo de distribución adopta una forma de campana, cuando nosotros

llegamos a tener más de 30 datos.

Normalmente la forma que toma es la Campana de Gauss, en donde nosotros vamos a


ver que

la mayoría de datos tienen al centro, hacia lado izquierdo tenemos los datos que
representan

la mayor cantidad en la variable y hacia el lado derecho, nosotros tenemos los datos que
tienen la mayor cantidad en la variable.

Digamos si hablamos por ejemplo de una variable como peso, aquí estarían los menos
pesados

y aquí tendríamos nosotros los que tienen mayor peso.

En el caso de la media, digamos la mediana y la moda que son las de tendencia central,

el uso que nosotros tenemos que darle, es encontrar en donde está la mayoría de los
datos.

Si nosotros observamos la distribución, la cantidad más grande de datos se agolpa acá

y entonces el interés de este tipo de cálculo es llegar a determinar en donde está el centro

de la distribución, porque estas medidas tienen al centro.

En el caso de la media que es la primera medida de tendencia central, si es una muestra


se

identifica con este símbolo, si el dato es de una población se utiliza este símbolo

que es la letra Mi griega μ.

Y nosotros vamos a tener entonces para el cálculo normalmente lo que se hace es una

sumatoria de todos los valores que adquiere la variable x, desde i=1 hasta n, dividido

el número total de datos n, esta es la forma de calcular la media, digamos si nosotros

tenemos 3 datos, 3 + 4 +5 por ejemplo, entonces tendríamos allí que esto sería = 12/3 y

la media sería igual a 4, es el dato que está en el centro de la distribución.

Verdad, eso sería para el caso de la media, la media ese es el cálculo y lo que nosotros

observamos es que la mayoría de datos esta por acá, eso nos ayuda en un momento dato

a identificar una población de interés.


En el caso de la media es una medida equidistante es decir que está en el centro de la
distancia

de los datos, por eso es bien importante tenerlo en cuenta.

En el caso de la media vamos a tener, hablábamos nosotros de una distribución de


campana en

el caso de la mediana vamos a ver que es la medida que está en el centro de los datos,

la media estará en el centro de las distancias.

Entonces cuando nosotros tenemos un caso particular digamos como este, en donde
tenemos una cantidad

de datos que está formando una tendencia central, pero luego tenemos un valor extremo

acá, sucede que la forma toma de esta como la cola más larga a la derecha.

Entonces lo que va pasar con la media ese dato jala hacia acá y entonces la media ya

no tiene sentido, porque nosotros lo que andamos buscando es donde está la gran
mayoría de

datos, sigue estando en este punto.

Esa se resuelve a través de otra medida de tendencia central que se conoce como
mediana,

la mediana lo que hace es que busca el centro para los datos, yo voy tachando uno de
cada

lado acá, pongo los datos ordenados y entonces observamos que nos queda muy en el
centro de la distribución.

A diferencia de la media que se vino para acá, la mediana si nos queda donde está

la mayoría de datos, así que yo creo que en Guatemala deberíamos estar calculando

más mediadas que medias, es un dato mucho más confiable, sobre todo cuando nosotros
tenemos valores muy extremos como este caso que mostrábamos acá.

Luego tenemos la moda, que es la tercer medida de tendencia central y la moda es la que
aparece

con mayor frecuencia, es decir que si yo tengo una serie de datos, digamos por ejemplo,
peso

de alimentos en un momento dato y tengo repetidos por ejemplo unas 6 veces el número 5
esa va a ser la moda.

La moda es el dato que se repite con mayor frecuencia, entonces de las 3 medidas de
tendencia

central, la media es el centro de las distancias, la mediana es el centro de los datos y la

moda es el que aparece con mayor frecuencia.

Nosotros deberíamos de utilizar la moda por ejemplo cuando trabajamos investigación de

mercados, que queremos saber qué es lo que la gente está prefiriendo en un momento
dado,

la preferencia por un producto en particular es lo que nosotros necesitamos calcular a


través de la moda.

Las 3 medidas de tendencia central son esas entonces, deberíamos de si los datos son

bien confiables, si no tenemos valores extremos nos vamos por la media, si nosotros
tenemos

muchos valores extremos deberíamos de irnos por la mediana y si lo que necesitamos es

ver la preferencia entonces calculamos la moda.

Los cuantiles son el otro tipo de medidas que nosotros vamos a calcular en estadística

descriptiva y lo que van a hacer es posicionarnos en algún punto en particular de interés,


digamos a lo largo de la distribución nos podría interesar, colocarnos en cualquiera

de los puntos de la distribución.

Son muy comunes hablar de cuartiles, luego tenemos los deciles y los percentiles, si

nosotros lo que queremos hacer es partir la distribución en 4 partes iguales, los cuartiles

nos a ser útiles, pero tendríamos nosotros prácticamente n en este caso partido 4, verdad

y el primer cuartil lo tendríamos acá, el cuartil 2 lo tendríamos por acá y el cuartil 3 lo


tendríamos por acá.

Imagínense que estamos calculando la evaluación de desempeño del personal en una


empresa,

en un momento dado, queremos por ejemplo aumentarles el 25% superior va a estar de


este lado, porque

cada uno de estos tiene un 25% de los datos dentro de la distribución.

Entonces los mejores trabajadores van a estar en este cuartil, nosotros los queremos
estimular,

pues vemos a partir de que calificación de evaluación de desempeño nosotros deberíamos


de ir para arriba.

Si en un momento dado necesitamos prescindir de un 25% del personal por cualquier


problema

que hay en el mercado, entonces el 25% menor estaría en este lado, eso sería entonces

la medida prácticamente de los cuartiles que lo que hacen es partir la distribución en 4


partes iguales.

Luego tenemos los deciles, los deciles lo que hacen es partir la distribución en 10

partes iguales, entonces en este caso nosotros vamos a tener una distribución donde
estaríamos

teniendo practicamente estos deciles desde el 1 acá,


el 2, 3, 4, 5, 6, 7, 8, 9 observemos que prácticamente el decil 5 es el mismo cuartil 2 y es
la misma mediana.

Verdad, si nosotros nos interesa por ejemplo en un momento dado el 20% superior
entonces

nosotros vamos a tener acá que el 20% superior lo estaríamos teniendo del decil 8 hacia
arriba.

Eso serían los deciles, estamos partiendo la distribución en 10 partes iguales.

Por ultimo tenemos los percentiles lo que van a hacer es partir la distribución en

100 partes iguales, aquí tendríamos nosotros, digamos si lo haríamos bien, cada uno de

estos bocados tiene 1% y eso nos va a dar un cálculo mucho más fino a la hora que

nosotros queramos calcular los percentiles.

Así que los cuartiles es n/4, los deciles es n/10 y los percentiles nosotros lo tendríamos
con n/100.

Estas medidas de posición al igual que las medidas de tendencia central nosotros
podemos

calcularlo con la herramienta de análisis de datos que lo vamos a estar viendo más

adelante, en un video especial, donde usted va poder cargar la herramienta y también

va poder hacer sus cálculos en una forma muy automatizada.

Vamos a calcular ahora las medidas de dispersión este es otro tipo de medidas que se le
conoce

como medidas de variación.

Algunos también las conocen como medidas de propagación, sucede que en una
distribución

nosotros podríamos tener una distribución normal como habíamos visto, pero podría
ver una distribución donde la forma sea esta, podríamos tener una como esta, si nosotros

observamos las 3 medidas de tendencia central que ya vimos, pues van a pegar en el
centro,

tanto la media, mediana como la moda, pegan en el centro.

Pero al ver la distribución vemos que la distribución es muy diferente, esta distribución

de acá tiene mucho más variabilidad que esta de acá.

Si nosotros hablamos por ejemplo de un negocio, aquí las ventas estarían mucho más
concentradas,

que, en este caso de acá, ose a que acá tendríamos datos con ventas muy bajas aquí

datos con ventas muy altas.

Las medidas de dispersión nos van a ayudar a nosotros a poder ver esa variabilidad que

existe, desde el país que estamos lanzando este curso, nosotros tenemos un país con
mucha variabilidad.

Verdad por ejemplo en la parte de biodiversidad este país mega diverso pero también en
el

tema de la riqueza hay mucho problema, la variabilidad es tan inherente.

Sin embargo no siempre el tema de la variabilidad el que sea muy amplio es malo, por
ejemplo

para hacer recolección de plantas a veces necesitamos tener una buena variabilidad.

Pero en los conceptos de calidad lo que se anda buscando es que la variabilidad se


reduzca al máximo.

Las medidas de uso más común, la primera va a ser el rango, simplemente el rango es

el dato mayor menos el dato menor y en algunos casos si nosotros queremos incluir los
extremos
se le suma 1, para que el valor extremo quede incluido.

Esa sería el rango, luego tenemos otra medida que se le conoce como desviación media,
la

desviación media quedo ya en desuso, sin embargo es la base para las otras medidas

y en una distribución digamos lo que se hace con la desviación media, es ver cada uno

de los datos, cada uno de los datos que tenemos en la distribución y lo que se hace es ver

la distancia que se tiene contra la media, por ejemplo este dato, si le llamamos x1,

este que tiene x2 acá, entonces nosotros estaríamos viendo, cual es la distancia de

todos los datos en relación a la media, así que la desviación media lo que hace es calcular

la sumatoria de todas las desviaciones pero se calcula en sentido absoluto, verdad,


porque

si no al estar la medida en el centro se eliminan las distancias dividido el número de datos

desde i=1 hasta n, esa es la medida.

Sirve para comparar 2 distribuciones entonces nosotros podemos tener una distribución
con

una desviación media de 8 por ejemplo contra otra de 15 y entonces vamos a decir que la

que tienen más variabilidad es la de 15, siempre y cuando la dimensional sea igual

y la variable que estemos trabajando sea la misma.

La tercer medida que nosotros podemos calcular es la varianza, la varianza se identifica

si es una muestra con una S² y si es una población la vamos a identificar como sigma al
cuadrado.
Para calcular la varianza nosotros tomamos la desviación que ya habíamos visto
anteriormente,

solo que en este caso en lugar de ponerle el valor absoluto se eleva al cuadrado, se

saca la sumatoria, desde i=1 hasta n, dividido el número de datos.

Es decir que la varianza es el promedio cuadrático de todas las desviaciones de los datos
respecto a la media.

Ahora la problemática acá es que digamos si estamos hablando por ejemplo de ventas,

el resultado podría ser esto, digamos en la moneda que estemos hablando, estaríamos

hablando de quetzales² o sea que la dimensional en este caso queda al cuadrado y es una
medida

que exagera a la variabilidad.

Es decir que cuando comparamos 2 poblaciones está exagerando por mucho la


variabilidad,

imagínense ustedes el cuadrado de 1 por ejemplo contra el cuadrado de 100.

Entonces allí nosotros tenemos una gran diferencia en este caso, debido a eso es que
esta medida

se ha transformado en otra medida que se conoce como desviación estándar o desviación


típica

que es lo más correcto de establecerlo y acá lo que hacemos es sacar la raíz cuadrada

de la desviación, entonces ya con eso lo regresamos a su dimensional original.

De tal manera que si teníamos digamos ventas en quetzales que es la moneda en


Guatemala,

lo regresamos únicamente a quetzales, o sea le eliminamos este cuadrado que tenemos


acá

y con eso ya podemos nosotros comparar la dispersión de los datos.


Las primeras 4 medidas, el rango, la desviación, la desviación media, la varianza y la
desviación

típica o estándar únicamente nos van a ser útiles cuando hablamos de la misma variable

y estamos hablando de una dimensional parecida es decir que nos sirve para comparar
contra

2 variables debido a esto es que se calcula otra medida verdad, que la vamos a conocer

nosotros como coeficiente de variación.

Entonces la referencia hacia el coeficiente de variación es que esta se calcula dividiendo

la desviación estándar / dentro de la media, normalmente se expresa en porcentajes y


entonces

se multiplica por 100.

Hay que tener cuidado porque algunos lo que hacen es multiplicar por n, pero lo que aquí

lo que estamos buscando es un porcentaje y por lo tanto debería de multiplicarse por 100.

Esta es una medida relativa, si nosotros tenemos aquí que la desviación esta digamos en
quetzales

y la media que habíamos visto anteriormente también está en quetzales.

Prácticamente esto se vuelve 1 y la medida se queda a dimensional.

Esto es importante porque entonces permite comparar variables diferentes, es decir en

un sentido común hablar de manzanas y peras, entonces podemos ver las variabilidades
de las 2.

Hay una convención en estadística que cuando la variabilidad es mayor de 20, existe una

variabilidad alta, si la variabilidad es menor de 20, entonces la variabilidad es bastante

baja y podríamos decir que la distribución es mejor.


Así que digamos variabilidades altas es cuando sobre pasa esto, algunos otros hacen
algunas

clasificaciones, pero en términos generales esto es lo correcto.

Las medidas de variación, entonces nos van a ayudar para ver la variabilidad la dispersión

de los datos, las 4 primeras para poder observar lo que es una dispersión dentro de una
misma variable.

Y esta última que permite comparar 2 variables diferentes.

Vamos a conocer ahora las medidas de forma, hay 2 tipos de cálculos que podríamos
hacer

allí, si la forma nosotros la vemos en el sentido horizontal o si la forma la vemos

en el sentido vertical.

Si nosotros tenemos una distribución que es completamente simétrica verdad, si digamos

este dibujo estuviera perfecto, si nosotros pudiéramos doblar ese pizarrón y las 2 colas

pegan exactamente como un espejo hacia acá, entonces vamos a hablar que
prácticamente

allí no hay sesgo, en otras palabras, estaríamos hablando que la distribución es


completamente simétrica.

Pero hay casos donde nosotros tenemos valores extremos hacia un lado, por ejemplo, si
es

al lado derecho acá, el coeficiente que vamos a calcular primero, que es un coeficiente

de asimetría nos va a resultar con un valor positivo.

Si nosotros tenemos, por el contrario, una cola más larga del lado izquierdo, el sesgo
va ser de tipo negativo y este que no tiene sesgo, que es completamente simétrico,
prácticamente

el cálculo nos daría un 0.

¿cómo se calcula?

hay varias formas de calcularlo hay uno, el primero de Pearson que calcula la media
menos

la moda dividido la desviación estándar.

Tenemos uno, un segundo coeficiente de Pearson que lo que hace es verlo contra la
mediana,

entonces es igual a 3 veces la media - la mediana / desviación estándar.

Y el que más se utiliza es uno que calcula el momento de orden 3, lo que hace es una

sumatoria de las desviaciones elevado a la 3, si es con datos agrupados, aquí esta


multiplicado

por la frecuencia dividido el número de datos, dividido la desviación estándar a la 3.

Verdad y entonces acá si el resultado es 0, pues es simétrica y si es positivo tiene

aquella forma y si es negativo tendría esa forma.

Ese es el coeficiente de asimetría con el que nosotros prácticamente vemos la forma

en el sentido horizontal.

Pero si lo que queremos es ver la forma en el sentido vertical digamos, tenemos una
distribución

muy puntiaguda como esta.

O tenemos muy aplastada como esta, esto se calcula a través de un coeficiente que se

conoce como curtosis y entonces la curtosis, lo que nos demuestra es precisamente eso si
es normal.
La normal generalmente se le conoce como mesocúrtica, la muy puntiaguda se le conoce
como leptocurtica

y si la distribución es muy aplastada se conoce como platicurtica.

Ahora el coeficiente el que se utilizó durante mucho tiempo, se calcula en una forma muy

parecido al sesgo, solo que en lugar de tener la desviación elevada a la 3, lo que lo va

tener es elevada a la 4.

Y dividido el número de datos, dividido la desviación estándar elevado a la 4.

Esa prácticamente es el cálculo de la curtosis, se identifica con una k por su nombre en


inglés,

verdad es muy común verla en esa forma y entonces si este resultado = 3, estaríamos

hablando de una mesocúrtica si es mayor que 3, es prácticamente es una leptocúrtica

y si es menor que 3, estamos hablando de una distribución platicurtica.

De hace un tiempo para acá para hacerle un mejor manejo, los ingenieros en sistema, le

han restado a todo esto 3, que en un caso es muy conveniente, porque al tener 3-3 vuelve
esto 0.

Y al restarle 3 este valor queda positivo y si le restamos 3 acá el valor va quedar negativo.

Entonces eso es muy conveniente en el manejo de cálculos posteriores porque uno dice,

bueno 0 es una distribución completamente normal.

¿Qué es lo que está indicando acá?

está indicando que digamos va ver una clase que tiene una frecuencia bastante alta, todo

los datos se están concentrando prácticamente en una clase, mientras que una
distribución
como esta digamos va a tener sus clases con las frecuencias digamos un poco más
uniformes.

Así que esas son las 2 medidas de forma en el sentido horizontal en el coeficiente de

asimetría, imagínense ustedes el peso a lo largo de la vida.

Primero tenemos un sesgo positivo, verdad muchos de nosotros cuando somos jóvenes
estábamos

abajo de la media, nos casamos normalizamos ya con nuestro dato muy simétrico y con el

tiempo pues vamos a ir teniendo un sesgo negativo o sea vamos a tener un peso por
encima de

la media, esto es útil también en los negocios, para observar tendencias en los negocios,

observar que tipo de comportamiento está teniendo verdad, si tenemos demasiados datos

por encima de la media, entonces podríamos tomar algunas medidas correctivas.

Y en el caso digamos de la curtosis, pues lo que nos va a indicar es a la larga, que

tan uniforme podrían estar los datos en un momento dado.

Así que estas son las medidas de variación con esto concluimos después de haber visto

variación ahora las de forma, concluimos prácticamente los 4 estadísticos que habíamos
visto.

No vamos a hacer los cálculos a mano, ahora con los softwares eso pues ya no tiene tanto

sentido, los vamos a hacer de una forma automatizada herramientas como las de Excel de
análisis

de datos nos van a ayudar a esto, así que vamos a tener un video exclusivo en donde

vamos a mostrar como instalar la herramienta, como hacer los cálculos.

Pero en esta parte de los videos que hemos visto lo que nos interesa o nos enfocamos
más que todo es en la interpretación de los datos.

Excel tiene una aplicación en datos que debemos de cargarla para poder utilizarla y esta
permite

realizar una serie de análisis estadísticos, vamos a mostrar como cargar esta opción,

este complemento en Excel, para ello lo que debemos de hacer es obviamente tener
nuestro

Excel abierto luego ir a archivo, en archivo nosotros buscamos opciones y en opciones


nos

va aparecer un cuadro con varias opciones y buscamos la de complementos, en


complementos

usted va encontrar del lado derecho, dos opciones que dice herramientas para análisis y
herramientas

para análisis Visual Basic, cualquiera de las dos, uno solo se coloca sobre ella y le

damos ir, en ese momento nos lleva a este cuadrito, en donde debemos de habilitar
herramienta

para análisis y herramienta para análisis de Visual Basic, todo lo que tenemos que hacer

es darle aceptar y luego usted va observar que si se va a datos debería de aparecerle

análisis de datos, acá hasta la esquina superior derecha, si vemos análisis de datos

pues es una herramienta que permite hacer varios de los cálculos estadísticos básicos,

va encontrar desde análisis de varianza, estadística descriptiva algunas pruebas de

medias, allí vamos a encontrar como trabajar covarianzas de análisis de regresión en

algunos casos, en los diferentes tipos de Excel usted va a encontrar complementos


siempre
en la parte de opciones, así es que todo lo que tenemos que hacer es buscar opciones

para poder ubicar en complementos la herramienta de análisis de datos, espero que


les sea de utilidad.

¿Cómo calcular la estadística descriptiva en Excel? con la herramienta de análisis

de datos es muy simple, nosotros lo que tenemos que hacer es ingresar la variable que
nos

interesa, digamos que si hablamos por ejemplo del peso de personas y colocamos
algunas cantidades

de peso, si nosotros hacemos un muestreo digamos que tenemos una persona que pesa
145 libras,

una que pesa 150 libras, alguien que pesa 160, alguien más con 165 libras, por allí

alguien con 155 , tenemos otra persona que pesa 170, 172, 145,150, 156, 135, 180, luego

tenemos a alguien que pesa 165, alguien con 156 y vamos a poner a una última persona

acá que pese 115, es una muestra de 15 personas, para que observemos como se puede
calcular

la estadística descriptiva de una forma muy fácil, ¿qué es lo que tenemos que hacer?
ingresar

a análisis de datos, luego buscamos la opción de estadística descriptiva, usted la va a

encontrar acá lo tenemos estadística descriptiva le damos aceptar y nos abre este diálogo,

hay una parte donde dice rango entrada de los datos, con esta flechita roja, nos devuelve

hacia la bases de datos original, todo lo que tenemos que hacer es, seleccionar los

datos, luego nuevamente con la flecha roja regresamos al cuadro de inicio, como usted

pudo ver acá le dejamos en la primer fila el título del peso, entonces hay que indicárselo
acá, si usted no tenía nada en la primer fila y de una vez tenia números, pues no

tiene que marcar nada en este sentido, bueno luego Excel tiene las opciones de sacar
aquí

mismo en esta hoja nuestros datos, por default lo puede tirar a una hoja nueva o a un libro

nuevo, saquémoslo aquí mismo, vamos a ir nuevamente a la hoja electrónica, solo tiene

que marcar la esquina a partir de donde quiere que salga su cuadro de estadística
descriptiva

y luego todo lo que tenemos que hacer es, pedir el resumen de estadísticas, usted le

da aceptar y tiene la estadística descriptiva básica de cualquier análisis, si usted observa

aquí tenemos algunas medidas de tendencia central, verdad como la mediana, la moda,

estas son medidas de tendencia central, luego tenemos algunas medidas de variación
como

la desviación estándar como la varianza, tenemos medidas de forma, con el coeficiente

de asimetría la curtosis, así que la estadística descriptiva básica la obtiene con este
utilitario,

acá también nosotros tenemos una opción de algunas cosas que no salen en este primer

cuadro y podemos ir nuevamente a análisis de datos y en la parte de histograma, nosotros

le damos aceptar y nuevamente con el mismo procedimiento, ingresamos nuestros datos,

luego colocamos que teníamos rótulo allí, le decimos que queremos que cree un gráfico,

le voy a marcar de nuevo un rango de salida y voy a pedirle que mi gráfica la coloque

por acá, si todavía no tengo un cálculo de rango de clase, lo dejamos en blanco por

default Excel aunque lo da con decimales nos va a dar un rango bastante adecuado. Así

que aquí tenemos nosotros nuestro gráfico, nuestro histograma de la información que
coloque en este caso de peso, también es muy útil acá, el que podamos calcular medidas

de posición los cuantiles, que son los únicos que nos aparecía acá en toda la estadística

descriptiva, entonces nos vamos a jerarquía y percentil le damos aceptar y colocamos el

rango de entrada de los datos y para que ahora veamos un diferencial le voy a dejar que
por

default me lo coloque en una hoja nueva y al darle aceptar usted va observar acá, me

ordena todos los datos en función del mayor al menor y por acá donde dice porcentaje,

prácticamente tendríamos los percentiles para este caso, así que esta herramienta

le puede ser de mucha utilidad para la estadística descriptiva básica.

También podría gustarte