Modulo 1
La primera unidad de este curso vamos a trabajar lo que es Análisis Exploratorio de
Datos.
Básicamente como calcular los estadísticos descriptivos, pero previo a esto es necesario
conocer algunos conceptos fundamentales, yo he visto personas que pueden hacer
cálculos
muy sofisticados estadísticos.
Sin embargo, podemos nosotros ver que por no tener algunos conceptos básicos claros
a veces, utilizan mal las herramientas que se necesitan aplicar.
La estadística lo que hace es que reduce la información y la transforma en valores
de interés que nos permitan analizar, pero sobre todos concluir, pero sobre todo decidir.
Por allí alguien decía que quien tiene la información tiene el poder, es parcialmente
cierto, porque tiene el poder si esa información la analiza, si de esa información saca
conclusiones
y eso le va a ayudar para tomar decisiones adecuadas.
Conozco información que tienen información, pero a la larga, la información digamos no
la utilizan adecuadamente.
Entonces la estadística da normas para procesos como la recolección, la organización, el
análisis, la interpretación de los datos para tomar decisiones adecuadas.
Cuando nosotros tenemos datos que se van sacando de una población en particular a eso
nosotros
le vamos a llamar estadísticos, quizás ustedes han visto por ejemplo las estadísticas de
los jugadores.
Por ejemplo, los jugadores de beisbol, de futbol, la cantidad de estadísticos que le
van calculando.
Tenemos también otro término que es importante y es el término población, para que
alguien
pertenezca a una población, tiene que tener una característica común verdad, por ejemplo,
nosotros podríamos hablar en un salón de clase por ejemplo.
Las personas que usan lentes, por ejemplo, ellos pueden formar una población que es
distinta a la misma población de la clase.
Aun cuando la persona tenga lentes de contacto, pero si tiene lentes, forma parte de esa
población,
aunque no se lo miremos físicamente.
Ahora si los datos son a partir de una muestra le vamos a llamar estadísticos, si son a
partir
de una población nosotros le vamos a llamar parámetros.
Y tenemos que la parte que distingue el elemento de la población nosotros le vamos a
llamar
característica.
La característica es el signo distintivo entonces para la población, debemos de tener
claro que esa característica puede ser de tipo Cualitativo o puede ser de tipo Cuantitativo
verdad, cuando hablamos nosotros de algo cualitativo, es porque no tiene grados de
comparación
verdad, nosotros podríamos hablar por ejemplo del sexo verdad, si hablamos de hombre o
mujer,
no hay grados de comparación.
Una mujer no puede decir que es mejor que el hombre, pero tampoco el hombre puede
decir
que es mejor que una mujer, porque cada quien tiene sus propios atributos, cada quien
tiene
una forma muy particular de ser.
Entonces allí no hay grados de comparación, allí estamos hablando de algo cualitativo,
los grupos se llaman modalidades, por ejemplo, el sabor verdad, alguien puede decir
miren
a mí me gusta más lo dulce, eso no quiere decir que lo dulce sea mejor que el salado.
Lo dulce es dulce y lo salado es salado es más el atributo puede tener variabilidad,
pero no hay nada correcto en decir esto es mejor que lo otro.
Mientras que una variable es así, esa permite grados de comparación, y entonces lo
importante
aquí que es una característica cuantitativa, verdad y los grupos que se forman son clases,
por ejemplo yo podría en un momento dado decir, el día de hoy si tuve un desayuno
muy abundante por ejemplo y que pesó 190.75 libras, o sea que subí, 0.75 el día, el
día de hoy.
Por ejemplo, entonces allí si hay grados de comparación, nosotros nos imaginamos
digamos
cuando alguien dice por ejemplo, yo no les podría decir yo peso 100 libras, nadie me
lo va a creer, ahora ¿por qué?
al verme mi cuerpo hay un sentido de comparación y eso sucede con las variables
cuantitativas.
Ahora hay variables cuantitativas de 2 tipos, de 2 clases, tenemos las variables
cuantitativas
discretas, que no permiten división o fraccionamiento, verdad, generalmente son números
enteros,
y luego tenemos las variables continuas que esas si permiten división o fraccionamiento,
en el caso de las discretas yo podría decir miren fíjense que yo tengo 2 hijos, una mi
cuñada por ejemplo tiene 1 hijo, alguien podría hablar de 4 hijos.
Pero nadie puede decir miren yo tengo 0.10 hijos eso no es posible decirlo, porque es
una variable de tipo discreta.
Nosotros hablamos por ejemplo de los latidos del corazón las pulsaciones esas son
discretas,
mientras que las variables continuas esas si permiten división o fraccionamiento.
Por ejemplo, el peso, la estatura, esas son variable de tipo continuo, pueden tener los
decimales que sean verdad.
Y en ese caso digamos es correcto hablar por ejemplo de una estatura hasta digamos
además
de metros, centímetros, milímetros, verdad no hay ningún problema porque tenemos una
continuidad.
Así es que digamos las características pueden ser de 3 tipos, los atributos que son
cualitativos, 2.
Cuantitativos donde tenemos las variables discretas y las variables continuas.
¿ahora por qué hacemos esta diferenciación?
porque dependiendo del tipo de variable que nosotros utilicemos, si va a hacer el tipo
de cálculos o el tipo de herramienta estadística que nosotros vamos a utilizar, al final la
estadística debe ser bien utilizada.
Me ha llamado la atención por ejemplo este autor de apellido Triola que escribe el libro
de estadística y el decía que no hay que utilizar la estadística como un borracho
lo utiliza como un poste de alumbrado público a las 2 de la mañana.
Un borracho digamos que viene a las 2 de la mañana allí cascabiando como decimos en
Guatemala, va utilizar el poste del alumbrado público para apoyarse, en la estadística no
es eso.
La estadística debe utilizarse para lo que verdaderamente sirve, el poste del alumbrado
público para alumbrarnos, para darnos luz sobre los datos y que nosotros podamos tomar
decisiones adecuadas.
Muy bien, vamos a principiar con lo que es recolectando datos, nosotros podríamos por
ejemplo tener una cantidad muy grande de datos y por aquí empieza el resumen de la
estadística,
por ejemplo, aquí tenemos cantidades de electrodomésticos vendidos semanalmente
durante 100 semanas.
Si yo les pregunto a ustedes cual es el, digamos la semana donde se vendió más, va a
costar
un poco ubicarnos verdad, por allí tenemos el dato, lo van a ubicar más adelante que
es 88 y luego podríamos preguntarnos quien es el que vende menos y entonces al estar
observando acá, vamos a observar que el que vende menos es 21, la semana donde se
vendió menos.
Pero no es fácil a primera vista encontrarlo y entonces allí es donde empezamos la
estadística,
simplemente ordenando los datos de menor a mayor o de mayor a menor.
Nosotros podríamos formar lo que se le conoce como una serie y vean allí ya los datos
ordenados
en Excel, simplemente colocan sus datos en una columna, le dan van al utilitario de datos,
le dicen ordenar de menor a mayor, automáticamente les va a ordenar todos los datos.
Anteriormente esto nos llevaba una cantidad de tiempo ordenando los datos, observen acá
allí es más fácil, la semana donde más se vendió fue 88, la semana donde menos se
vendió fue 21.
Hay que ir a ver cuál es esa semana, los datos del centro, andan por alrededor de 55
verdad, entonces ya teniendo las series nosotros podemos un ordenamiento muy rápido
de los datos.
Luego es conveniente formar clases, con esto formamos lo que se llama una tabla de
distribución
de frecuencias, a través de la fórmula de Sturges es muy utilizada, en donde vamos a
tener el rango recorrido dividido 1 + 3.322 log n.
En los datos anteriores nosotros restamos 88-21 + 1, para incluir el extremo del lado
izquierdo nosotros tendríamos que el recorrido total es de 68 dividido 1+3.322log de base
10 de 100 porque en este caso tenemos 100 datos.
Nos da 8.9, podemos aproximar allí a 9, como dato más correcto, así que le damos 9 al
tamaño de la clase, digamos que por ejemplo en la primera clase arrancamos con el dato
menor que es 21, incluyendo el valor de la izquierda 21, 22, 23, 24,25, 26, 27, 28, y
tendríamos 29, entonces nosotros tenemos allí prácticamente una amplitud de 9.
Si vamos a ver la serie los datos tendríamos que entre 21-29 hay prácticamente 4 datos,
esa es la frecuencia que está reflejada acá, luego de 30 a 38, nosotros observamos la
serie
estando ordenados y allí si empezamos a contar del 32, 33 hasta adelante tendríamos 12
antes de llegar al 38.
Así que teniendo ya nuestra conformación en clases nos ayuda para tomar decisiones
más adecuadas, vemos que hay 23 semanas, en donde lo que se está vendiendo es entre
48 a 56 electrodomésticos, habría que observar esas semanas porque allí está la mayoría,
pero podríamos ir a observar las 3 últimas que es donde se está vendiendo más.
Probablemente allí está la semana de Navidad o en un momento dado, digamos un
mundial,
digamos en el mes de junio como otra semana buena.
Y eso es donde se está vendiendo más electrodomésticos y podríamos ver que las
semanas más bajas
probablemente que se yo podría ser enero y febrero y otro par de semanas allí.
Y esto nos va a ayudar a tomar decisiones en los negocios, observar donde está la
mayoría
de datos, porque allí es donde se está vendiendo de una forma regular, podríamos
observar
donde hay venta de más electrodomésticos, donde hay venta de menos
electrodomésticos.
Muy bien, a continuación podríamos calcular una serie de medidas descriptivas y hay de 4
formas, en próximos videos nosotros vamos a mostrar información y los conceptos básicos
de estas medidas, las de tendencia central, las de dispersión, las de posición y las de
forma
que lo vamos a calcular en Excel con la herramienta de análisis de datos.
En esta segunda parte nosotros vamos a conocer los estadísticos principales que nosotros
podemos calcular en una cantidad de datos, vamos a tener 4 grandes grupos estadísticos
que nosotros podemos calcular.
Entre ellos tenemos los de tendencia central lo que buscan es el centro de la distribución,
luego si queremos posicionarnos en algún punto particular de la distribución nosotros
podemos calcular los cuantiles.
Tenemos también que, si queremos ver la dispersión de los datos, para ello se calculan
otro tipo
de estadísticos que se conoce como medidas de variación.
Y luego si queremos conocer la forma de la distribución, tanto en el sentido horizontal,
como el sentido vertical, podemos calcular las medidas de forma.
Iniciaremos con las medidas de tendencia central, en cuanto a las medidas de tendencia
central
las más comunes, ustedes las han escuchado son la Media, Moda, Mediana, aunque
también
existen otras pocas conocidas como el Eje intercuartílico, Intervalo medio.
Cuando nosotros tenemos una distribución y queremos ver una cantidad de datos,
generalmente
los datos los podemos poner sobre un eje de coordenadas en donde el eje x, nosotros
vamos
a colocar la variable de interés y en el eje de la y, vamos a colocar la frecuencia
o la cantidad de datos.
Generalmente en este tipo de distribución adopta una forma de campana, cuando nosotros
llegamos a tener más de 30 datos.
Normalmente la forma que toma es la Campana de Gauss, en donde nosotros vamos a
ver que
la mayoría de datos tienen al centro, hacia lado izquierdo tenemos los datos que
representan
la mayor cantidad en la variable y hacia el lado derecho, nosotros tenemos los datos que
tienen la mayor cantidad en la variable.
Digamos si hablamos por ejemplo de una variable como peso, aquí estarían los menos
pesados
y aquí tendríamos nosotros los que tienen mayor peso.
En el caso de la media, digamos la mediana y la moda que son las de tendencia central,
el uso que nosotros tenemos que darle, es encontrar en donde está la mayoría de los
datos.
Si nosotros observamos la distribución, la cantidad más grande de datos se agolpa acá
y entonces el interés de este tipo de cálculo es llegar a determinar en donde está el centro
de la distribución, porque estas medidas tienen al centro.
En el caso de la media que es la primera medida de tendencia central, si es una muestra
se
identifica con este símbolo, si el dato es de una población se utiliza este símbolo
que es la letra Mi griega μ.
Y nosotros vamos a tener entonces para el cálculo normalmente lo que se hace es una
sumatoria de todos los valores que adquiere la variable x, desde i=1 hasta n, dividido
el número total de datos n, esta es la forma de calcular la media, digamos si nosotros
tenemos 3 datos, 3 + 4 +5 por ejemplo, entonces tendríamos allí que esto sería = 12/3 y
la media sería igual a 4, es el dato que está en el centro de la distribución.
Verdad, eso sería para el caso de la media, la media ese es el cálculo y lo que nosotros
observamos es que la mayoría de datos esta por acá, eso nos ayuda en un momento dato
a identificar una población de interés.
En el caso de la media es una medida equidistante es decir que está en el centro de la
distancia
de los datos, por eso es bien importante tenerlo en cuenta.
En el caso de la media vamos a tener, hablábamos nosotros de una distribución de
campana en
el caso de la mediana vamos a ver que es la medida que está en el centro de los datos,
la media estará en el centro de las distancias.
Entonces cuando nosotros tenemos un caso particular digamos como este, en donde
tenemos una cantidad
de datos que está formando una tendencia central, pero luego tenemos un valor extremo
acá, sucede que la forma toma de esta como la cola más larga a la derecha.
Entonces lo que va pasar con la media ese dato jala hacia acá y entonces la media ya
no tiene sentido, porque nosotros lo que andamos buscando es donde está la gran
mayoría de
datos, sigue estando en este punto.
Esa se resuelve a través de otra medida de tendencia central que se conoce como
mediana,
la mediana lo que hace es que busca el centro para los datos, yo voy tachando uno de
cada
lado acá, pongo los datos ordenados y entonces observamos que nos queda muy en el
centro de la distribución.
A diferencia de la media que se vino para acá, la mediana si nos queda donde está
la mayoría de datos, así que yo creo que en Guatemala deberíamos estar calculando
más mediadas que medias, es un dato mucho más confiable, sobre todo cuando nosotros
tenemos valores muy extremos como este caso que mostrábamos acá.
Luego tenemos la moda, que es la tercer medida de tendencia central y la moda es la que
aparece
con mayor frecuencia, es decir que si yo tengo una serie de datos, digamos por ejemplo,
peso
de alimentos en un momento dato y tengo repetidos por ejemplo unas 6 veces el número 5
esa va a ser la moda.
La moda es el dato que se repite con mayor frecuencia, entonces de las 3 medidas de
tendencia
central, la media es el centro de las distancias, la mediana es el centro de los datos y la
moda es el que aparece con mayor frecuencia.
Nosotros deberíamos de utilizar la moda por ejemplo cuando trabajamos investigación de
mercados, que queremos saber qué es lo que la gente está prefiriendo en un momento
dado,
la preferencia por un producto en particular es lo que nosotros necesitamos calcular a
través de la moda.
Las 3 medidas de tendencia central son esas entonces, deberíamos de si los datos son
bien confiables, si no tenemos valores extremos nos vamos por la media, si nosotros
tenemos
muchos valores extremos deberíamos de irnos por la mediana y si lo que necesitamos es
ver la preferencia entonces calculamos la moda.
Los cuantiles son el otro tipo de medidas que nosotros vamos a calcular en estadística
descriptiva y lo que van a hacer es posicionarnos en algún punto en particular de interés,
digamos a lo largo de la distribución nos podría interesar, colocarnos en cualquiera
de los puntos de la distribución.
Son muy comunes hablar de cuartiles, luego tenemos los deciles y los percentiles, si
nosotros lo que queremos hacer es partir la distribución en 4 partes iguales, los cuartiles
nos a ser útiles, pero tendríamos nosotros prácticamente n en este caso partido 4, verdad
y el primer cuartil lo tendríamos acá, el cuartil 2 lo tendríamos por acá y el cuartil 3 lo
tendríamos por acá.
Imagínense que estamos calculando la evaluación de desempeño del personal en una
empresa,
en un momento dado, queremos por ejemplo aumentarles el 25% superior va a estar de
este lado, porque
cada uno de estos tiene un 25% de los datos dentro de la distribución.
Entonces los mejores trabajadores van a estar en este cuartil, nosotros los queremos
estimular,
pues vemos a partir de que calificación de evaluación de desempeño nosotros deberíamos
de ir para arriba.
Si en un momento dado necesitamos prescindir de un 25% del personal por cualquier
problema
que hay en el mercado, entonces el 25% menor estaría en este lado, eso sería entonces
la medida prácticamente de los cuartiles que lo que hacen es partir la distribución en 4
partes iguales.
Luego tenemos los deciles, los deciles lo que hacen es partir la distribución en 10
partes iguales, entonces en este caso nosotros vamos a tener una distribución donde
estaríamos
teniendo practicamente estos deciles desde el 1 acá,
el 2, 3, 4, 5, 6, 7, 8, 9 observemos que prácticamente el decil 5 es el mismo cuartil 2 y es
la misma mediana.
Verdad, si nosotros nos interesa por ejemplo en un momento dado el 20% superior
entonces
nosotros vamos a tener acá que el 20% superior lo estaríamos teniendo del decil 8 hacia
arriba.
Eso serían los deciles, estamos partiendo la distribución en 10 partes iguales.
Por ultimo tenemos los percentiles lo que van a hacer es partir la distribución en
100 partes iguales, aquí tendríamos nosotros, digamos si lo haríamos bien, cada uno de
estos bocados tiene 1% y eso nos va a dar un cálculo mucho más fino a la hora que
nosotros queramos calcular los percentiles.
Así que los cuartiles es n/4, los deciles es n/10 y los percentiles nosotros lo tendríamos
con n/100.
Estas medidas de posición al igual que las medidas de tendencia central nosotros
podemos
calcularlo con la herramienta de análisis de datos que lo vamos a estar viendo más
adelante, en un video especial, donde usted va poder cargar la herramienta y también
va poder hacer sus cálculos en una forma muy automatizada.
Vamos a calcular ahora las medidas de dispersión este es otro tipo de medidas que se le
conoce
como medidas de variación.
Algunos también las conocen como medidas de propagación, sucede que en una
distribución
nosotros podríamos tener una distribución normal como habíamos visto, pero podría
ver una distribución donde la forma sea esta, podríamos tener una como esta, si nosotros
observamos las 3 medidas de tendencia central que ya vimos, pues van a pegar en el
centro,
tanto la media, mediana como la moda, pegan en el centro.
Pero al ver la distribución vemos que la distribución es muy diferente, esta distribución
de acá tiene mucho más variabilidad que esta de acá.
Si nosotros hablamos por ejemplo de un negocio, aquí las ventas estarían mucho más
concentradas,
que, en este caso de acá, ose a que acá tendríamos datos con ventas muy bajas aquí
datos con ventas muy altas.
Las medidas de dispersión nos van a ayudar a nosotros a poder ver esa variabilidad que
existe, desde el país que estamos lanzando este curso, nosotros tenemos un país con
mucha variabilidad.
Verdad por ejemplo en la parte de biodiversidad este país mega diverso pero también en
el
tema de la riqueza hay mucho problema, la variabilidad es tan inherente.
Sin embargo no siempre el tema de la variabilidad el que sea muy amplio es malo, por
ejemplo
para hacer recolección de plantas a veces necesitamos tener una buena variabilidad.
Pero en los conceptos de calidad lo que se anda buscando es que la variabilidad se
reduzca al máximo.
Las medidas de uso más común, la primera va a ser el rango, simplemente el rango es
el dato mayor menos el dato menor y en algunos casos si nosotros queremos incluir los
extremos
se le suma 1, para que el valor extremo quede incluido.
Esa sería el rango, luego tenemos otra medida que se le conoce como desviación media,
la
desviación media quedo ya en desuso, sin embargo es la base para las otras medidas
y en una distribución digamos lo que se hace con la desviación media, es ver cada uno
de los datos, cada uno de los datos que tenemos en la distribución y lo que se hace es ver
la distancia que se tiene contra la media, por ejemplo este dato, si le llamamos x1,
este que tiene x2 acá, entonces nosotros estaríamos viendo, cual es la distancia de
todos los datos en relación a la media, así que la desviación media lo que hace es calcular
la sumatoria de todas las desviaciones pero se calcula en sentido absoluto, verdad,
porque
si no al estar la medida en el centro se eliminan las distancias dividido el número de datos
desde i=1 hasta n, esa es la medida.
Sirve para comparar 2 distribuciones entonces nosotros podemos tener una distribución
con
una desviación media de 8 por ejemplo contra otra de 15 y entonces vamos a decir que la
que tienen más variabilidad es la de 15, siempre y cuando la dimensional sea igual
y la variable que estemos trabajando sea la misma.
La tercer medida que nosotros podemos calcular es la varianza, la varianza se identifica
si es una muestra con una S² y si es una población la vamos a identificar como sigma al
cuadrado.
Para calcular la varianza nosotros tomamos la desviación que ya habíamos visto
anteriormente,
solo que en este caso en lugar de ponerle el valor absoluto se eleva al cuadrado, se
saca la sumatoria, desde i=1 hasta n, dividido el número de datos.
Es decir que la varianza es el promedio cuadrático de todas las desviaciones de los datos
respecto a la media.
Ahora la problemática acá es que digamos si estamos hablando por ejemplo de ventas,
el resultado podría ser esto, digamos en la moneda que estemos hablando, estaríamos
hablando de quetzales² o sea que la dimensional en este caso queda al cuadrado y es una
medida
que exagera a la variabilidad.
Es decir que cuando comparamos 2 poblaciones está exagerando por mucho la
variabilidad,
imagínense ustedes el cuadrado de 1 por ejemplo contra el cuadrado de 100.
Entonces allí nosotros tenemos una gran diferencia en este caso, debido a eso es que
esta medida
se ha transformado en otra medida que se conoce como desviación estándar o desviación
típica
que es lo más correcto de establecerlo y acá lo que hacemos es sacar la raíz cuadrada
de la desviación, entonces ya con eso lo regresamos a su dimensional original.
De tal manera que si teníamos digamos ventas en quetzales que es la moneda en
Guatemala,
lo regresamos únicamente a quetzales, o sea le eliminamos este cuadrado que tenemos
acá
y con eso ya podemos nosotros comparar la dispersión de los datos.
Las primeras 4 medidas, el rango, la desviación, la desviación media, la varianza y la
desviación
típica o estándar únicamente nos van a ser útiles cuando hablamos de la misma variable
y estamos hablando de una dimensional parecida es decir que nos sirve para comparar
contra
2 variables debido a esto es que se calcula otra medida verdad, que la vamos a conocer
nosotros como coeficiente de variación.
Entonces la referencia hacia el coeficiente de variación es que esta se calcula dividiendo
la desviación estándar / dentro de la media, normalmente se expresa en porcentajes y
entonces
se multiplica por 100.
Hay que tener cuidado porque algunos lo que hacen es multiplicar por n, pero lo que aquí
lo que estamos buscando es un porcentaje y por lo tanto debería de multiplicarse por 100.
Esta es una medida relativa, si nosotros tenemos aquí que la desviación esta digamos en
quetzales
y la media que habíamos visto anteriormente también está en quetzales.
Prácticamente esto se vuelve 1 y la medida se queda a dimensional.
Esto es importante porque entonces permite comparar variables diferentes, es decir en
un sentido común hablar de manzanas y peras, entonces podemos ver las variabilidades
de las 2.
Hay una convención en estadística que cuando la variabilidad es mayor de 20, existe una
variabilidad alta, si la variabilidad es menor de 20, entonces la variabilidad es bastante
baja y podríamos decir que la distribución es mejor.
Así que digamos variabilidades altas es cuando sobre pasa esto, algunos otros hacen
algunas
clasificaciones, pero en términos generales esto es lo correcto.
Las medidas de variación, entonces nos van a ayudar para ver la variabilidad la dispersión
de los datos, las 4 primeras para poder observar lo que es una dispersión dentro de una
misma variable.
Y esta última que permite comparar 2 variables diferentes.
Vamos a conocer ahora las medidas de forma, hay 2 tipos de cálculos que podríamos
hacer
allí, si la forma nosotros la vemos en el sentido horizontal o si la forma la vemos
en el sentido vertical.
Si nosotros tenemos una distribución que es completamente simétrica verdad, si digamos
este dibujo estuviera perfecto, si nosotros pudiéramos doblar ese pizarrón y las 2 colas
pegan exactamente como un espejo hacia acá, entonces vamos a hablar que
prácticamente
allí no hay sesgo, en otras palabras, estaríamos hablando que la distribución es
completamente simétrica.
Pero hay casos donde nosotros tenemos valores extremos hacia un lado, por ejemplo, si
es
al lado derecho acá, el coeficiente que vamos a calcular primero, que es un coeficiente
de asimetría nos va a resultar con un valor positivo.
Si nosotros tenemos, por el contrario, una cola más larga del lado izquierdo, el sesgo
va ser de tipo negativo y este que no tiene sesgo, que es completamente simétrico,
prácticamente
el cálculo nos daría un 0.
¿cómo se calcula?
hay varias formas de calcularlo hay uno, el primero de Pearson que calcula la media
menos
la moda dividido la desviación estándar.
Tenemos uno, un segundo coeficiente de Pearson que lo que hace es verlo contra la
mediana,
entonces es igual a 3 veces la media - la mediana / desviación estándar.
Y el que más se utiliza es uno que calcula el momento de orden 3, lo que hace es una
sumatoria de las desviaciones elevado a la 3, si es con datos agrupados, aquí esta
multiplicado
por la frecuencia dividido el número de datos, dividido la desviación estándar a la 3.
Verdad y entonces acá si el resultado es 0, pues es simétrica y si es positivo tiene
aquella forma y si es negativo tendría esa forma.
Ese es el coeficiente de asimetría con el que nosotros prácticamente vemos la forma
en el sentido horizontal.
Pero si lo que queremos es ver la forma en el sentido vertical digamos, tenemos una
distribución
muy puntiaguda como esta.
O tenemos muy aplastada como esta, esto se calcula a través de un coeficiente que se
conoce como curtosis y entonces la curtosis, lo que nos demuestra es precisamente eso si
es normal.
La normal generalmente se le conoce como mesocúrtica, la muy puntiaguda se le conoce
como leptocurtica
y si la distribución es muy aplastada se conoce como platicurtica.
Ahora el coeficiente el que se utilizó durante mucho tiempo, se calcula en una forma muy
parecido al sesgo, solo que en lugar de tener la desviación elevada a la 3, lo que lo va
tener es elevada a la 4.
Y dividido el número de datos, dividido la desviación estándar elevado a la 4.
Esa prácticamente es el cálculo de la curtosis, se identifica con una k por su nombre en
inglés,
verdad es muy común verla en esa forma y entonces si este resultado = 3, estaríamos
hablando de una mesocúrtica si es mayor que 3, es prácticamente es una leptocúrtica
y si es menor que 3, estamos hablando de una distribución platicurtica.
De hace un tiempo para acá para hacerle un mejor manejo, los ingenieros en sistema, le
han restado a todo esto 3, que en un caso es muy conveniente, porque al tener 3-3 vuelve
esto 0.
Y al restarle 3 este valor queda positivo y si le restamos 3 acá el valor va quedar negativo.
Entonces eso es muy conveniente en el manejo de cálculos posteriores porque uno dice,
bueno 0 es una distribución completamente normal.
¿Qué es lo que está indicando acá?
está indicando que digamos va ver una clase que tiene una frecuencia bastante alta, todo
los datos se están concentrando prácticamente en una clase, mientras que una
distribución
como esta digamos va a tener sus clases con las frecuencias digamos un poco más
uniformes.
Así que esas son las 2 medidas de forma en el sentido horizontal en el coeficiente de
asimetría, imagínense ustedes el peso a lo largo de la vida.
Primero tenemos un sesgo positivo, verdad muchos de nosotros cuando somos jóvenes
estábamos
abajo de la media, nos casamos normalizamos ya con nuestro dato muy simétrico y con el
tiempo pues vamos a ir teniendo un sesgo negativo o sea vamos a tener un peso por
encima de
la media, esto es útil también en los negocios, para observar tendencias en los negocios,
observar que tipo de comportamiento está teniendo verdad, si tenemos demasiados datos
por encima de la media, entonces podríamos tomar algunas medidas correctivas.
Y en el caso digamos de la curtosis, pues lo que nos va a indicar es a la larga, que
tan uniforme podrían estar los datos en un momento dado.
Así que estas son las medidas de variación con esto concluimos después de haber visto
variación ahora las de forma, concluimos prácticamente los 4 estadísticos que habíamos
visto.
No vamos a hacer los cálculos a mano, ahora con los softwares eso pues ya no tiene tanto
sentido, los vamos a hacer de una forma automatizada herramientas como las de Excel de
análisis
de datos nos van a ayudar a esto, así que vamos a tener un video exclusivo en donde
vamos a mostrar como instalar la herramienta, como hacer los cálculos.
Pero en esta parte de los videos que hemos visto lo que nos interesa o nos enfocamos
más que todo es en la interpretación de los datos.
Excel tiene una aplicación en datos que debemos de cargarla para poder utilizarla y esta
permite
realizar una serie de análisis estadísticos, vamos a mostrar como cargar esta opción,
este complemento en Excel, para ello lo que debemos de hacer es obviamente tener
nuestro
Excel abierto luego ir a archivo, en archivo nosotros buscamos opciones y en opciones
nos
va aparecer un cuadro con varias opciones y buscamos la de complementos, en
complementos
usted va encontrar del lado derecho, dos opciones que dice herramientas para análisis y
herramientas
para análisis Visual Basic, cualquiera de las dos, uno solo se coloca sobre ella y le
damos ir, en ese momento nos lleva a este cuadrito, en donde debemos de habilitar
herramienta
para análisis y herramienta para análisis de Visual Basic, todo lo que tenemos que hacer
es darle aceptar y luego usted va observar que si se va a datos debería de aparecerle
análisis de datos, acá hasta la esquina superior derecha, si vemos análisis de datos
pues es una herramienta que permite hacer varios de los cálculos estadísticos básicos,
va encontrar desde análisis de varianza, estadística descriptiva algunas pruebas de
medias, allí vamos a encontrar como trabajar covarianzas de análisis de regresión en
algunos casos, en los diferentes tipos de Excel usted va a encontrar complementos
siempre
en la parte de opciones, así es que todo lo que tenemos que hacer es buscar opciones
para poder ubicar en complementos la herramienta de análisis de datos, espero que
les sea de utilidad.
¿Cómo calcular la estadística descriptiva en Excel? con la herramienta de análisis
de datos es muy simple, nosotros lo que tenemos que hacer es ingresar la variable que
nos
interesa, digamos que si hablamos por ejemplo del peso de personas y colocamos
algunas cantidades
de peso, si nosotros hacemos un muestreo digamos que tenemos una persona que pesa
145 libras,
una que pesa 150 libras, alguien que pesa 160, alguien más con 165 libras, por allí
alguien con 155 , tenemos otra persona que pesa 170, 172, 145,150, 156, 135, 180, luego
tenemos a alguien que pesa 165, alguien con 156 y vamos a poner a una última persona
acá que pese 115, es una muestra de 15 personas, para que observemos como se puede
calcular
la estadística descriptiva de una forma muy fácil, ¿qué es lo que tenemos que hacer?
ingresar
a análisis de datos, luego buscamos la opción de estadística descriptiva, usted la va a
encontrar acá lo tenemos estadística descriptiva le damos aceptar y nos abre este diálogo,
hay una parte donde dice rango entrada de los datos, con esta flechita roja, nos devuelve
hacia la bases de datos original, todo lo que tenemos que hacer es, seleccionar los
datos, luego nuevamente con la flecha roja regresamos al cuadro de inicio, como usted
pudo ver acá le dejamos en la primer fila el título del peso, entonces hay que indicárselo
acá, si usted no tenía nada en la primer fila y de una vez tenia números, pues no
tiene que marcar nada en este sentido, bueno luego Excel tiene las opciones de sacar
aquí
mismo en esta hoja nuestros datos, por default lo puede tirar a una hoja nueva o a un libro
nuevo, saquémoslo aquí mismo, vamos a ir nuevamente a la hoja electrónica, solo tiene
que marcar la esquina a partir de donde quiere que salga su cuadro de estadística
descriptiva
y luego todo lo que tenemos que hacer es, pedir el resumen de estadísticas, usted le
da aceptar y tiene la estadística descriptiva básica de cualquier análisis, si usted observa
aquí tenemos algunas medidas de tendencia central, verdad como la mediana, la moda,
estas son medidas de tendencia central, luego tenemos algunas medidas de variación
como
la desviación estándar como la varianza, tenemos medidas de forma, con el coeficiente
de asimetría la curtosis, así que la estadística descriptiva básica la obtiene con este
utilitario,
acá también nosotros tenemos una opción de algunas cosas que no salen en este primer
cuadro y podemos ir nuevamente a análisis de datos y en la parte de histograma, nosotros
le damos aceptar y nuevamente con el mismo procedimiento, ingresamos nuestros datos,
luego colocamos que teníamos rótulo allí, le decimos que queremos que cree un gráfico,
le voy a marcar de nuevo un rango de salida y voy a pedirle que mi gráfica la coloque
por acá, si todavía no tengo un cálculo de rango de clase, lo dejamos en blanco por
default Excel aunque lo da con decimales nos va a dar un rango bastante adecuado. Así
que aquí tenemos nosotros nuestro gráfico, nuestro histograma de la información que
coloque en este caso de peso, también es muy útil acá, el que podamos calcular medidas
de posición los cuantiles, que son los únicos que nos aparecía acá en toda la estadística
descriptiva, entonces nos vamos a jerarquía y percentil le damos aceptar y colocamos el
rango de entrada de los datos y para que ahora veamos un diferencial le voy a dejar que
por
default me lo coloque en una hoja nueva y al darle aceptar usted va observar acá, me
ordena todos los datos en función del mayor al menor y por acá donde dice porcentaje,
prácticamente tendríamos los percentiles para este caso, así que esta herramienta
le puede ser de mucha utilidad para la estadística descriptiva básica.