0% encontró este documento útil (0 votos)
0 vistas10 páginas

Adobe Scan 14 abr 2026

El documento discute la importancia de la variabilidad en conjuntos de datos, destacando cómo la media y la amplitud pueden ser insuficientes para describir la dispersión. Se introduce la variancia y la desviación estándar como medidas más precisas de variabilidad, junto con el teorema de Tchebysheff, que establece que un porcentaje específico de datos caerá dentro de un intervalo determinado de desviaciones estándar. Se enfatiza que la variabilidad es crucial para la interpretación de datos en diversas aplicaciones prácticas.

Cargado por

camila vera
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
0 vistas10 páginas

Adobe Scan 14 abr 2026

El documento discute la importancia de la variabilidad en conjuntos de datos, destacando cómo la media y la amplitud pueden ser insuficientes para describir la dispersión. Se introduce la variancia y la desviación estándar como medidas más precisas de variabilidad, junto con el teorema de Tchebysheff, que establece que un porcentaje específico de datos caerá dentro de un intervalo determinado de desviaciones estándar. Se enfatiza que la variabilidad es crucial para la interpretación de datos en diversas aplicaciones prácticas.

Cargado por

camila vera
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF o lee en línea desde Scribd
34 CAPITULO 2 * DESCRIPCI z : z i g 3 : i FIGURA 25. Distribuciones de frecuencias relativas qu ——— 2.6 FIGURA 2.6 ION DE CONJUNTOS DE DATOS a Mediana Media (b) 1 muestran el efecto de valores extremos sobre la media y la medias Medidas de variabilidad Después de haber localizado el centro de una distribucién de datos, debe obtenerse. ui medida de la variabilidad o de la dispersién de los datos. Considérense las dos distribuci mee mostradas en la Figura 2.6. Ambas distribuciones tienen el centro en x = 4, pero h una gran diferencia en la variabilidad de las mediciones alrededor de la media para | dos distribuciones. La mayoria de las mediciones en la Figura 2.6(a) varian entre 3 y pero en la Figura 2.6(b) varian entre 0 y 8. La variacién es una caracteristica muy imps ante de los datos. Por ejemplo, al fabricar pernos, la variacién excesiva en el didme del perno ocasionaria un alto porcentaje de productos defectuosos. Sin embargo, al ut zar un examen para discriminar entre buenos y malos contadores, seria desconsolador g él examen siempre proporcionara resultados con poca variacién, lo que haria la discrin nacién muy dificil. Aparte de la importancia préctica de la variacién en los datos, se ns sita una medida de esta caracteristica para la claboracién de la imagen mental de la is : 2 3 3 | i i dottilitr. Miri N, a ryyasers @ () | Variabilidad 0 dispersion de datos | DEFINICION FIGURA 2.7 FIGURA 2.8 2.6 © Medidas de Variabilidad 35 bucién de frecuencias. Existen muchas medidas de la variabilidad, y discutiremos algunas de las mas importantes. La medida de variacién mas sencilla es la amplitud* La amplitud de un conjunto de n mediciones x4, x2, %4, ---, Xp, S€ define como la dife- rencia entre la mayor y la menor. 0 Los datos de rendimientos de dividendos de la Tabla 2.3 variaban entre 2.3 y 5.3. Por lo tanto, la amplitud es igual a (5.3 — 2.3) = 3.0. Esta medida se calcula y se interpreta facilmente, y es muy adecuada para medir la variacién de pequefios conjuntos de datos. Pero en el caso de conjuntos grandes, la amplitud puede ser insensible a diferencias sus- tanciales en la variacién de los datos. Esta insensibilidad se ilustra mediante dos distribu- ciones de frecuencias relativas en la Figura 2.7. Ambas distribuciones tienen la misma am- plitud, pero los datos de la Figura 2.7(b) tienen mayor variabilidad que los de la Figura 2.7(a). g 2 i i 2 q g 2 z E & é 6 * Caraga ga wer ees SRO SES @ Distribuciones con amplitud igual y diferente variabilidad Para encontrar una medida més sensible de la variacién de los datos, examinaremos un conjunto de ellos —digamos el conjunto 5, 7, 1, 2, 4. Estos datos se pueden representar graficamente como en la Figura 2.8 al ubicar las mediciones como puntos sobre el eje x. La Figura 2.8 se llama diagrama de puntos. 38 Diagrama de puntos <1 término usado en yor traduecién incorrecta de rar se usa el término amplitud toral cuando se consideran otras + (N. det R.) Esta medida se Hama a veces erréneamente “rang inglés. Se denomina también alcance 0 recortido. Para especificar, clases de amplitud, 36 TABLA 2.11 \EFINICION DEFINIC RIPCION DE CONJUNTOS DE DATOS CAPITULO 2 # D ‘Al calcular la media como una medida de tendencia central, obtenemos 19 a n 5 y se sittia en el diagrama de puntos. Podemos interpretar ahora la variabilidad en func de la distancia entre cada punto (medicion) y la media ¥. Si las distancias son grands podemos decir que los datos son mas variables que cuando las distancias son pequeti De manera mas explicita, definiremos la desviacién de una medicién respecto de su me como la expresidn (x; — ¥). Notese que las mediciones a la derecha de la media tienen Viaciones positivas y las que estan a la izquierda, desviaciones negativas. Los valores “xy las desviaciones para nuestro ejemplo se muestran en las columnas 1 y [Link] la Tabla 2. Caileulo de F(x, — 3) Pee Ss 12 1.44 7 32 10.24 1 -28 784 2 Si &y) 4 02 0.04 x= 19 0 22.80 Si ahora estamos de acuerdo en que las desviaciones contienen informacion acerca la variaci6n, el préximo paso es obtener una formula basada en las desviaciones que curaré una buena medida de la variacién. Como una primera posibilidad, podriamos coger la media de las desviaciones. Desafortunadamente, esta media no funcionard, que algunas de las. desviaciones son positivas y otras negativas; entonces la suma de desviaciones es siempre igual a cero (a menos que se hayan introducido errores de red deo en los calculos). Nétese, por ejemplo, que las desviaciones en la segunda columna la Tabla 2.11 suman cero. Hay maneras-de evitar ese problema. ,Por qué no calcular la media de los vali absolutos de las desviaciones? Se ha utilizado, efectivamente, este método como una dida de la variabilidad; pero es dificil de interpretar, y tiende a ser poco satisfactorio la inferencia estadistica. Se prefiere evitar la dificultad causada por el signo de las des ciones, al trabajar con la suma de sus cuadrados, Sine Cuando la cantidad o numero fijo de mediciones es grande, los datos seran mas varial que cuando el numero es pequefio. La variancia (0 varianza)* de una poblacidn de N mediciones xy, | Xy, se de como la media de los cuadrados de las desviaciones de las mediciones respecto a su pr + ON. del R.) Aunque varianciaes el término correcto y ras adecuado, puesto que designa la calidad de variante, do el uso del nombre "varianza”, que resulta ser un itaianismo innecesario. Compdrense los términos andlog Invariancia; constante, constancia, etcetera sehace DEFINICION DEFINICION 2.6 © Medidas de Variabilidad 37 media u. La variancia poblacional se denota por o? (o es la letra griega sigma mintiscula) y esté dada por la formula is) Notese que utilizamos N para indicar el niimero de mediciones en una poblacién y m para el numero de mediciones en una muestra. Al definir la variancia de mediciones muestrales, cambiaremos el procedimiento para evaluar la media, ya que se dividira la suma de los cuadrados entre (m — 1) en lugar de entre n. La variancia de una muestra de n mediciones x1, X2, .-., X,, Se define como la suma de los cuadrados de las desviaciones de las mediciones respecto a su media Z dividida entre (a - 1). La variancia muestral se denota por s? y se determina mediante la formula x, — x)? 1 a Dividimos entre (1 — 1) porque se desea utilizar, en tltimo anilisis, la variancia muestral s? para estimar la variancia poblacional o?. Las estimaciones obtenidas al dividir la suma de los cuadrados de las desviaciones entre n tienden a subestimar 0. La divisién entre (n ~ 1) elimina esta dificultad. Como ejemplo se calcularé la variancia del conjunto de 1 = 5 mediciones presentado en la Tabla 2.11. Al sumar obtenemos Fei — x)? = 22.80 1 La variancia muestral es {Qué significacién practica puede atribuirse a la variancia como una medida de la va- riabilidad? Variancias grandes indican un alto grado de variacién, pero esta afirmacion s6lo permite comparar varios conjuntos de datos. Cuando se trata de decir algo especifico respecto a un solo conjunto de datos, entonces se esta en un problema. Por ejemplo, ;qué se puede decir acerca de la variabilidad de un conjunto de datos con una variancia igual a 100? La respuesta a estas preguntas la da un teorema y una regia empirica que se enun- ciara y explicard en la siguiente seccion. Estas reglas interpretan la variabilidad de un con- junto de datos en términos de su desviacién estandar. La desviacion estandar de un conjunto den mediciones x, X2, X3, «+» Xm &8 igual a la raiz cuadrada positiva de la variancia. 0 mide en términos del cuadrado de las unidades originales de las medi- n kilogramos al cuadrado, para datos originales positiva de la variancia, obtenemos la desviacién La variancia se ciones. Asi, la variancia se expresaria e en kilogramos. Al sacar la raiz cuadrada CAPITULO 2 * DESCRIPCION DE CONJUNTOS DE DATOS estindar, que regresa la medida de variabilidad a las unidades originales de las medicio- nes. Se denota la desviacidn estindar muestral por el simbolo s y la desviacién estdndar poblacional por el simbolo 0. | ESVIACION ESTANDAR MUESTRAL- SiMBOLOS Desviacidn esténdar muestral: Desviacién esténdar poblacional: Significado Practico de la ____ Desviacién Estandar 2 7 Ahora se expondra un teorema interesante y util, desarrollado por el matematico ru: « / Tchebysheff (0 Chebyshev). La demostracién del teorema no ¢s dificil, pero la omitim en nuestra discusién. TEOREMA 2.1: TEOREMA DE TCHEBYSHEFF Dado un numero k mayor que o igual a I y un conjunto de n mediciones x,, x2 zs Xp al menos (1 ~ 1/K2) de las mediciones se encontrardn dentro de k desvi cones esténdares desde su media. El teorema de Tchebysheff se puede aplicar a cualquier conjunto de mediciones, y ps ilustrarlo podriamos referirnos a una muestra 0 a una poblacién. Utilizaremos las not. ciones poblacionales, pero podriamos con igual facilidad utilizar ¥ y s, como la media’ a desviacién estdndar de la muestra." *+ La demostracin del teorema de Tehebysheff para un conjunto finito de mediciones se basa en una variancia defini cs Lis - 9? cs decir, con un divisor n en lugar de (m~ 1), que s¢ usd para calcular s? Como s? siempre ser mayor que n> (n~ 1), el Leorema de Tehebysheff siempre se vetificard cuando se utiliza s para formar intervalos respecto de ¥. caso, habré una muy pequefa diferencia numérica en los valores de s y 5” para valores de m moderadamente grandes, FIGURA 2.9 TABLA 2.12 EJEMPLO 2.4 SOLUCION 39 2.7 © Significado Prictico de la Desviacién Estindar Por lo: menos Vek Frecuencia relativa Tlustracién del teorema de Tchebysheff La idea asociada al teorema de Tchebysheff se aclara en la Figura 2.9. Se construye un intervalo al Yijar una distancia de ka a ambos lados de la media 1. Notese que el teore- ma es valido para cualquier valor de k que se elija, con tal de que sea por lo menos igual a1. Entonces, al calcular la fraccién 1 — 1/K2, vemos que el teorema de Tchebysheff afir- ma que por lo menos esta fraccién del numero total de mediciones caerd dentro del in- tervalo determinado. Escojamos algunos valores numéricos para k y calcilese 1 — 1/k? (véase la Tabla 2.12). Cuando k = 1, el teorema afirma que por lo menos 1 ~ 1/(1)* = 0 de las medi- ciones caen dentro del intervalo deli — o a » + o,)un resultado poco informativo y sin uso practico. Sin embargo, cuando k — 2, vemos que al menos 1 — 1/(2)? = 3/4 de las mediciones caerdn en el intervalo dé (u — 2a) a (u + 20)! Al menos 8/9 de las medicio- nes estaran en el intervalo de — 30) a (x + 3) =< decir, dentro de tres desviaciones estandares de la media. strativos de 1 — 1/k? k Vk? 1 0 vy 2 3/4 3 8/9 Ahora consideraremos un ejemplo donde se aplicard la media y la desviacién estandar (0 la variancia) para formar una imagen mental de la distribucién de las mediciones de la cual se obtuvieron la media y la desviacién esténdar. La media y la variancia de una muestra con n = 25 mediciones, son 75 y 100, respectiva- mente. Utilizar el teorema de Tchebysheff para describir la distribucién de las mediciones. Los datos son ¥ = 75 y s? = 100. La desviacién estandar ess = V100 = 10. La distri- bucién se centra aproximadamente en £ = 75, y el teorema de Tchebysheff afirma lo si- guiente: (a) Al menos 3/4 de las 25 mediciones caen en el intervalo (X + 2s) = [75 + 2(10)], es decir, de 55 a 95. (b) Al menos 8/9 de las mediciones caen en el intervalo (¥ + 3s) = [75 + 3(10)], es de- cir, de 45a105. 0 FIGURA 29 TABLA 2.12 EJEMPLO 2.4 SOLUCION 2.7 © Significado Practica de la Desviacién Estindar 39 Frecuencia relativa Hustracién del teorema de Tchebysheff La idea asociada al teorema de Tchebysheff se aclara en la Figura 2.9. Se construye un intervalo al fijar una distancia de ko a ambos lados de la media z. Notese que el teore- ma es valido para cualquier valor de k que se elija, con tal de que sea por lo menos igual a 1. Entonces, al calcular la fraccién 1 — 1/k?, vemos que el teorema de Tchebysheff afir- ma que por lo menos esta fraccién del mimero total de n mediciones caer dentro del in- tervalo determinado. Escojamos algunos valores numéricos para k y calciilese 1 — 1/k? (véase la Tabla 2.12). Cuando k = 1, el teorema afirma que por lo menos 1 — 1/(1)* = 0 de las medi- ciones caen dentro del intervalo de'u— 0 a u + o,/un resultado poco informativo y sin uso practico. Sin embargo, cuando k = 2, vemos que al menos 1 ~ 1/(2)? = 3/4 de las mediciones caerdn en el intervalo d¢ (y ~ 20) a (4 + 20)! Al menos 8/9 de las medicio- nes estardn en el intervalo de (4 — 30) a (1 +30) es decir, dentro de tres desviaciones esténdares de la media. Valores ilustrativos de 1 — 1/k? k = Vie 1 Oo 4 2 3/4 3 8/9 Ahora consideraremos un ejemplo donde se aplicara la media y la desviacion estindar (0 la variancia) para formar una imagen mental de la distribucién de las mediciones de Ja cual se obtuvieron la media y la desviacion estandar. La media y la variancia de una muestra con 1 = 25 ediciones, son 75 y 100, respectiva- mente. Utilizar el teorema de Tchebysheff para describir la distribucién de las mediciones, Los datos son ¥ = 75 y s* = 100, La desviaci6n esténdar es s = Vi00 = 10. La distri- bucién se centra aproximadamente en ¥ = 75, y el teorema de Tchebyshetf afirma lo si- guiente: (a) Al menos 3/4 de las 25 mediciones caen en el intervalo (¢ + 2s) = [75 + 2(10)], es decir, de 55 a 95. (b) Al menos 8/9 de las mediciones caen en el intervalo (¥ + 3s) = [75 + 3(10)], es de- cir, de 45a 105. 0 _—_——S UU 40 CAPITULO 2. * DESCRIPCION DE CONTUNTOS DE DATOS Jc Tchebysheff es muy conservador. Se puede aplicar a cualquier distri Dy, 1a inferior para la fraccién de mediciones A, mayor(a de los casos, la verdadera frace El tcorem: cidn de mediciones y proporciona una cacn dento de un intervalo especifico. Bn sera mucho mas grande que (1 ~ 1/k?) El examen de muchos conjuntos de datos sugiere una regia empirica que sirve er Snterpretacién de una desviacidn estandar, Describe exactamente la variabilidad de distribucién particular con forma de campana o acampanada (véase la Figura 2.10), come cida como distribucién normal y que se discutira en detalle en el Capitulo 4. Pero tarnbie proporciona una descripcién excelente de la variacién de muchos otros tipos de datos ar poseen distribuciones de frecuencias relativas con forma de pico de montafia. Por tal o 76n se la Hama Regla Empiriea (de la distribucién normal) f Frecuencia relativa FIGURA 2.10 La distribucién normal LA _REGLA EMPIRICA | Dada una distribucién de mediciones que tiene aproximadamente el perfil o forms acampanada (véase la Figura 2.10): | = 1._El intervalo (y + 0) contendra aproximadamente 68% de las mediciones. 2. El intervalo (4 + 20) contendré aproximadamente 95% de las mediciones. 3._El intervalo (4 + 30) contendr casi la totalidad de las mediciones LO 2.5 Se realiz6 un estudio de tiempo para determinar el tiempo necesario para efectuar una a raci6n especifica en una fabrica o planta manufacturera. El tiempo (en minutos) neces. para efectuar la operacién completa se midié para cada uno de n = 40 trabajadores. media y Ja desviacién estandar fueron iguales a 12.8 y 1.7 minutos, respectivamente. criba los datos. JCION Para describir los datos, calculamos los intervalos: Fes = 128417 obien Ita 14s Ka 2s = 1284217) obien 94a 16.2 Fry = 128437) obien 7.7 a 17.9 41 2.7. © Signifieado Fractico de la Desviacién Estindar Aunque no tenemos informacidn anterior acerca de la distribucién de los datos, hay una buena posibilidad de que tendra forma de campana y que la Regla Empirica dard una descripcidn aceptable de los datos. Segiin la citada regla es de esperar que aproximada- mente 689% de los datos estén en el intervalo de 11.1 a 14.5; aproximadamente 95%, en el intervalo de 9.4 a 16.2, y casi la totalidad de los datos en el de 7.7 a 17.9. Si no estamos seguros de si la distribucién de las mediciones tiene forma de pico de montafa, o si por alguna razén, se desea ser conservador, entonces puede aplicarse el teo- rema de Tchebysheff y estar absolutamente seguro de nuestras afirmaciones. El teorema de Tchebysheff dice que al menos 3/4 de las mediciones caerdn en el intervalo de 9.4 a 16.2, y al menos 8/9, en el de 7.7 a 17.9. a Qué tan bien se aplica la Regla Empirica a los datos de rendimientos de la Tabla 2.3? Se vera en la Seccién 2.8 que la media y la desviacién esténdar para n = 25 mediciones son € = 3.57 y s = 0.81, Se calcularon los intervalos apropiados, y se registré el ntimero de mediciones que caen en cada intervalo. [Link] se muestran en la Tabla 2.13, ||/ con k en la primera columna y el intervald (+ + ks) len la segunda columna, utilizando >| ¥ = 3.57 ys = 0.81. La frecuencia o el mimero-de miediciones que caen en cada intervalo se tiene en la tercera columna, y la frecuencia relativa, en la cuarta. Notese que las fre- cuencias relativas observadas concuerdan con el teorema de Tchebysheff y que estan rela- tivamente cerca de las frecuencias relativas especificadas por la Regla Empirica. Otra manera de ver qué tan bien puede aplicarse la Regla Empirica y el teorema de Tchebysheff a los datos del rendimiento de dividendos es marcar los intervalos (X + 5), (% + 2s) y (¥ + 3s) en el histograma de frecuencias relativas para los datos, como se muestra en la Figura 2.11. Ahora recuérdese que el drea bajo el perfil del histograma sobre un in. 6/25 5/25 4ps 372s Frecuencia relativa 2125 125 -/-—___ Rendimiento de dividendos FIGURA 2.11 Histograma para los datos del rendimiento de dividendos (Figura 2.1) con los intervalos f + 5, ¥ + 2s y $+ 3s Sobrepuestos CAPITULO 2 # DESCRIPCION DE CONJUNTOS DE DATOS te sualmente la proporcidn del area por encima del intervalo (x + 3). Se vera que esta 0, ¢s proporcional al mimero de mediciones que caen en cl intervalo; apréciese y Pr porcidn esta cerca del 0.68 especificado por la Regla Empirica. Similarmente, se nota que casi toda el area se encuentra por encima del intervalo x + 25. Claramente, la Rey Empitica y el teorema de Tchebysheff, utilizando X y s, procuran una buena descripcig para los datos del rendimiento de dividendos. TABLA 2.13. Frecuencia de las mediciones que se encuentran dentro de k desviaciones estindares respecio de la media, pa los datos de la Tabla 2.3 . Intervalo, Frecuencia Frecuencia k itks en interyalo relativa 1 2.76-4,38 7 68 2 195-519 4 96 3 1.14-6.00 25 1.00 ' Para coneluir, nétese que el teorema de Tchebysheff es un hecho que se puede deme trar matematicamente, y que se aplica a cualquier conjunto de datos. Proporciona uy cota inferior para la fraccién de mediciones que se pueden encontrar en un inter: (¥ +s), donde k es un mimero mayor que o igual a uno. Al contrario, la Regla Empi ‘ca es una afirmacion arbitraria acerca del comportamiento dv: los datos. Aunque los | centajes contenidos en la regla vienen del érea bajo la curva normal (Figura 2.10), los | mos porcentajes son validos aproximadamente para Pd m listribuciones con forma diferen: mientras que tienden a tener forma de pico de montaiia (0 sea, los datos tienden a acum, "Yarse cerca del centro de la distribucién). Hemos visto que la regla es valida para los day del rendimiento de dividendos. Si se necesita estar mas convencido, calctilese ¥ y s pa un conjunto de datos que se escoja y verifiquese la fraccién de mediciones que caen | los intervalos (¥ + s), (¥ + 2s) y (¥ + 35). Creemos que se encontrar que las frecues ni relativas observadas estan razonablemente cerca de los valores especificados por la a Empirica. EJERCICIOS TECNICAS BASICAS @ @& 2.4 2.25 2.26 Dadas n = 5 mediciones: 0, 5, 1, 1, 3, determine lo que sigue: (a) % (b) m @s Dadas n = 8 mediciones: 3, 1, 5, 6, 4, 4, 3, 5, determine lo siguiente: (az (b) m os Dadas n = 10 mediciones: 3, 5, 4, 6, 10, 5, 6, 9, 2, 8, halle lo siguiente: (az (b) m @s Dadas n = 6 mediciones: 3, 0, 2, 2,1, 4, halle lo (a) z (b) m os Dadas n = $ mediciones: 2, 4, 0, 3, 1, encuentre lo siguiente: (az wm ws ‘Supéngase que quiere crear una representacién mental del histograma de frecuencias relativas tun gran conjunto de datos, que consiste en 1000 observaciones, y que se sabe que la media y lt viacin estdndar son 36 y 3, respectivamente, |

También podría gustarte