0 calificaciones 0% encontró este documento útil (0 votos) 0 vistas 10 páginas Adobe Scan 14 abr 2026
El documento discute la importancia de la variabilidad en conjuntos de datos, destacando cómo la media y la amplitud pueden ser insuficientes para describir la dispersión. Se introduce la variancia y la desviación estándar como medidas más precisas de variabilidad, junto con el teorema de Tchebysheff, que establece que un porcentaje específico de datos caerá dentro de un intervalo determinado de desviaciones estándar. Se enfatiza que la variabilidad es crucial para la interpretación de datos en diversas aplicaciones prácticas.
Descripción mejorada con IA
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido,
reclámalo aquí .
Formatos disponibles
Descarga como PDF o lee en línea desde Scribd
Ir a elementos anteriores Ir a siguientes elementos
Guardar Adobe Scan 14 abr 2026 para más tarde
34 CAPITULO 2 * DESCRIPCI
z :
z i
g 3
: i
FIGURA 25. Distribuciones de frecuencias relativas qu
———
2.6
FIGURA 2.6
ION DE CONJUNTOS DE DATOS
a
Mediana Media
(b)
1 muestran el efecto de valores extremos sobre la media y la medias
Medidas de variabilidad
Después de haber localizado el centro de una distribucién de datos, debe obtenerse. ui
medida de la variabilidad o de la dispersién de los datos. Considérense las dos distribuci
mee mostradas en la Figura 2.6. Ambas distribuciones tienen el centro en x = 4, pero h
una gran diferencia en la variabilidad de las mediciones alrededor de la media para |
dos distribuciones. La mayoria de las mediciones en la Figura 2.6(a) varian entre 3 y
pero en la Figura 2.6(b) varian entre 0 y 8. La variacién es una caracteristica muy imps
ante de los datos. Por ejemplo, al fabricar pernos, la variacién excesiva en el didme
del perno ocasionaria un alto porcentaje de productos defectuosos. Sin embargo, al ut
zar un examen para discriminar entre buenos y malos contadores, seria desconsolador g
él examen siempre proporcionara resultados con poca variacién, lo que haria la discrin
nacién muy dificil. Aparte de la importancia préctica de la variacién en los datos, se ns
sita una medida de esta caracteristica para la claboracién de la imagen mental de la is
: 2
3 3
|
i i
dottilitr. Miri N,
a ryyasers
@ () |
Variabilidad 0 dispersion de datos |DEFINICION
FIGURA 2.7
FIGURA 2.8
2.6 © Medidas de Variabilidad 35
bucién de frecuencias. Existen muchas medidas de la variabilidad, y discutiremos algunas
de las mas importantes.
La medida de variacién mas sencilla es la amplitud*
La amplitud de un conjunto de n mediciones x4, x2, %4, ---, Xp, S€ define como la dife-
rencia entre la mayor y la menor. 0
Los datos de rendimientos de dividendos de la Tabla 2.3 variaban entre 2.3 y 5.3. Por
lo tanto, la amplitud es igual a (5.3 — 2.3) = 3.0. Esta medida se calcula y se interpreta
facilmente, y es muy adecuada para medir la variacién de pequefios conjuntos de datos.
Pero en el caso de conjuntos grandes, la amplitud puede ser insensible a diferencias sus-
tanciales en la variacién de los datos. Esta insensibilidad se ilustra mediante dos distribu-
ciones de frecuencias relativas en la Figura 2.7. Ambas distribuciones tienen la misma am-
plitud, pero los datos de la Figura 2.7(b) tienen mayor variabilidad que los de la Figura
2.7(a).
g 2
i i
2 q
g 2
z E
& é
6 * Caraga ga wer ees SRO SES
@
Distribuciones con amplitud igual y diferente variabilidad
Para encontrar una medida més sensible de la variacién de los datos, examinaremos
un conjunto de ellos —digamos el conjunto 5, 7, 1, 2, 4. Estos datos se pueden representar
graficamente como en la Figura 2.8 al ubicar las mediciones como puntos sobre el eje x.
La Figura 2.8 se llama diagrama de puntos.
38
Diagrama de puntos
<1 término usado en
yor traduecién incorrecta de rar
se usa el término amplitud toral cuando se consideran otras
+ (N. det R.) Esta medida se Hama a veces erréneamente “rang
inglés. Se denomina también alcance 0 recortido. Para especificar,
clases de amplitud,36
TABLA 2.11
\EFINICION
DEFINIC
RIPCION DE CONJUNTOS DE DATOS
CAPITULO 2 # D
‘Al calcular la media como una medida de tendencia central, obtenemos
19 a
n 5
y se sittia en el diagrama de puntos. Podemos interpretar ahora la variabilidad en func
de la distancia entre cada punto (medicion) y la media ¥. Si las distancias son grands
podemos decir que los datos son mas variables que cuando las distancias son pequeti
De manera mas explicita, definiremos la desviacién de una medicién respecto de su me
como la expresidn (x; — ¥). Notese que las mediciones a la derecha de la media tienen
Viaciones positivas y las que estan a la izquierda, desviaciones negativas. Los valores
“xy las desviaciones para nuestro ejemplo se muestran en las columnas 1 y [Link] la Tabla 2.
Caileulo de F(x, — 3)
Pee
Ss 12 1.44
7 32 10.24
1 -28 784
2 Si &y)
4 02 0.04
x= 19 0 22.80
Si ahora estamos de acuerdo en que las desviaciones contienen informacion acerca
la variaci6n, el préximo paso es obtener una formula basada en las desviaciones que
curaré una buena medida de la variacién. Como una primera posibilidad, podriamos
coger la media de las desviaciones. Desafortunadamente, esta media no funcionard,
que algunas de las. desviaciones son positivas y otras negativas; entonces la suma de
desviaciones es siempre igual a cero (a menos que se hayan introducido errores de red
deo en los calculos). Nétese, por ejemplo, que las desviaciones en la segunda columna
la Tabla 2.11 suman cero.
Hay maneras-de evitar ese problema. ,Por qué no calcular la media de los vali
absolutos de las desviaciones? Se ha utilizado, efectivamente, este método como una
dida de la variabilidad; pero es dificil de interpretar, y tiende a ser poco satisfactorio
la inferencia estadistica. Se prefiere evitar la dificultad causada por el signo de las des
ciones, al trabajar con la suma de sus cuadrados,
Sine
Cuando la cantidad o numero fijo de mediciones es grande, los datos seran mas varial
que cuando el numero es pequefio.
La variancia (0 varianza)* de una poblacidn de N mediciones xy, | Xy, se de
como la media de los cuadrados de las desviaciones de las mediciones respecto a su pr
+ ON. del R.) Aunque varianciaes el término correcto y ras adecuado, puesto que designa la calidad de variante,
do el uso del nombre "varianza”, que resulta ser un itaianismo innecesario. Compdrense los términos andlog
Invariancia; constante, constancia, etcetera
sehaceDEFINICION
DEFINICION
2.6 © Medidas de Variabilidad 37
media u. La variancia poblacional se denota por o? (o es la letra griega sigma mintiscula)
y esté dada por la formula
is)
Notese que utilizamos N para indicar el niimero de mediciones en una poblacién y m para
el numero de mediciones en una muestra.
Al definir la variancia de mediciones muestrales, cambiaremos el procedimiento para
evaluar la media, ya que se dividira la suma de los cuadrados entre (m — 1) en lugar de
entre n.
La variancia de una muestra de n mediciones x1, X2, .-., X,, Se define como la suma de
los cuadrados de las desviaciones de las mediciones respecto a su media Z dividida entre
(a - 1). La variancia muestral se denota por s? y se determina mediante la formula
x, — x)?
1 a
Dividimos entre (1 — 1) porque se desea utilizar, en tltimo anilisis, la variancia muestral
s? para estimar la variancia poblacional o?. Las estimaciones obtenidas al dividir la suma
de los cuadrados de las desviaciones entre n tienden a subestimar 0. La divisién entre
(n ~ 1) elimina esta dificultad.
Como ejemplo se calcularé la variancia del conjunto de 1 = 5 mediciones presentado
en la Tabla 2.11. Al sumar obtenemos
Fei — x)? = 22.80
1
La variancia muestral es
{Qué significacién practica puede atribuirse a la variancia como una medida de la va-
riabilidad? Variancias grandes indican un alto grado de variacién, pero esta afirmacion
s6lo permite comparar varios conjuntos de datos. Cuando se trata de decir algo especifico
respecto a un solo conjunto de datos, entonces se esta en un problema. Por ejemplo, ;qué
se puede decir acerca de la variabilidad de un conjunto de datos con una variancia igual
a 100? La respuesta a estas preguntas la da un teorema y una regia empirica que se enun-
ciara y explicard en la siguiente seccion. Estas reglas interpretan la variabilidad de un con-
junto de datos en términos de su desviacién estandar.
La desviacion estandar de un conjunto den mediciones x, X2, X3, «+» Xm &8 igual a la
raiz cuadrada positiva de la variancia. 0
mide en términos del cuadrado de las unidades originales de las medi-
n kilogramos al cuadrado, para datos originales
positiva de la variancia, obtenemos la desviacién
La variancia se
ciones. Asi, la variancia se expresaria e
en kilogramos. Al sacar la raiz cuadradaCAPITULO 2 * DESCRIPCION DE CONJUNTOS DE DATOS
estindar, que regresa la medida de variabilidad a las unidades originales de las medicio-
nes. Se denota la desviacidn estindar muestral por el simbolo s y la desviacién estdndar
poblacional por el simbolo 0. |
ESVIACION ESTANDAR MUESTRAL-
SiMBOLOS
Desviacidn esténdar muestral:
Desviacién esténdar poblacional:
Significado Practico de la
____ Desviacién Estandar
2 7 Ahora se expondra un teorema interesante y util, desarrollado por el matematico ru:
« / Tchebysheff (0 Chebyshev). La demostracién del teorema no ¢s dificil, pero la omitim
en nuestra discusién.
TEOREMA 2.1: TEOREMA DE TCHEBYSHEFF
Dado un numero k mayor que o igual a I y un conjunto de n mediciones x,, x2
zs Xp al menos (1 ~ 1/K2) de las mediciones se encontrardn dentro de k desvi
cones esténdares desde su media.
El teorema de Tchebysheff se puede aplicar a cualquier conjunto de mediciones, y ps
ilustrarlo podriamos referirnos a una muestra 0 a una poblacién. Utilizaremos las not.
ciones poblacionales, pero podriamos con igual facilidad utilizar ¥ y s, como la media’
a desviacién estdndar de la muestra."
*+ La demostracin del teorema de Tehebysheff para un conjunto finito de mediciones se basa en una variancia defini cs
Lis - 9?
cs decir, con un divisor n en lugar de (m~ 1), que s¢ usd para calcular s? Como s? siempre ser mayor que
n> (n~ 1), el Leorema de Tehebysheff siempre se vetificard cuando se utiliza s para formar intervalos respecto de ¥.
caso, habré una muy pequefa diferencia numérica en los valores de s y 5” para valores de m moderadamente grandes,FIGURA 2.9
TABLA 2.12
EJEMPLO 2.4
SOLUCION
39
2.7 © Significado Prictico de la Desviacién Estindar
Por lo: menos
Vek
Frecuencia relativa
Tlustracién del teorema de Tchebysheff
La idea asociada al teorema de Tchebysheff se aclara en la Figura 2.9. Se construye
un intervalo al Yijar una distancia de ka a ambos lados de la media 1. Notese que el teore-
ma es valido para cualquier valor de k que se elija, con tal de que sea por lo menos igual
a1. Entonces, al calcular la fraccién 1 — 1/K2, vemos que el teorema de Tchebysheff afir-
ma que por lo menos esta fraccién del numero total de mediciones caerd dentro del in-
tervalo determinado.
Escojamos algunos valores numéricos para k y calcilese 1 — 1/k? (véase la Tabla
2.12). Cuando k = 1, el teorema afirma que por lo menos 1 ~ 1/(1)* = 0 de las medi-
ciones caen dentro del intervalo deli — o a » + o,)un resultado poco informativo y sin
uso practico. Sin embargo, cuando k — 2, vemos que al menos 1 — 1/(2)? = 3/4 de las
mediciones caerdn en el intervalo dé (u — 2a) a (u + 20)! Al menos 8/9 de las medicio-
nes estaran en el intervalo de — 30) a (x + 3) =< decir, dentro de tres desviaciones
estandares de la media.
strativos de 1 — 1/k?
k Vk?
1 0
vy 2 3/4
3 8/9
Ahora consideraremos un ejemplo donde se aplicard la media y la desviacién estandar
(0 la variancia) para formar una imagen mental de la distribucién de las mediciones de
la cual se obtuvieron la media y la desviacién esténdar.
La media y la variancia de una muestra con n = 25 mediciones, son 75 y 100, respectiva-
mente. Utilizar el teorema de Tchebysheff para describir la distribucién de las mediciones.
Los datos son ¥ = 75 y s? = 100. La desviacién estandar ess = V100 = 10. La distri-
bucién se centra aproximadamente en £ = 75, y el teorema de Tchebysheff afirma lo si-
guiente:
(a) Al menos 3/4 de las 25 mediciones caen en el intervalo (X + 2s) = [75 + 2(10)], es
decir, de 55 a 95.
(b) Al menos 8/9 de las mediciones caen en el intervalo (¥ + 3s) = [75 + 3(10)], es de-
cir, de 45a105. 0FIGURA 29
TABLA 2.12
EJEMPLO 2.4
SOLUCION
2.7 © Significado Practica de la Desviacién Estindar 39
Frecuencia relativa
Hustracién del teorema de Tchebysheff
La idea asociada al teorema de Tchebysheff se aclara en la Figura 2.9. Se construye
un intervalo al fijar una distancia de ko a ambos lados de la media z. Notese que el teore-
ma es valido para cualquier valor de k que se elija, con tal de que sea por lo menos igual
a 1. Entonces, al calcular la fraccién 1 — 1/k?, vemos que el teorema de Tchebysheff afir-
ma que por lo menos esta fraccién del mimero total de n mediciones caer dentro del in-
tervalo determinado.
Escojamos algunos valores numéricos para k y calciilese 1 — 1/k? (véase la Tabla
2.12). Cuando k = 1, el teorema afirma que por lo menos 1 — 1/(1)* = 0 de las medi-
ciones caen dentro del intervalo de'u— 0 a u + o,/un resultado poco informativo y sin
uso practico. Sin embargo, cuando k = 2, vemos que al menos 1 ~ 1/(2)? = 3/4 de las
mediciones caerdn en el intervalo d¢ (y ~ 20) a (4 + 20)! Al menos 8/9 de las medicio-
nes estardn en el intervalo de (4 — 30) a (1 +30) es decir, dentro de tres desviaciones
esténdares de la media.
Valores ilustrativos de 1 — 1/k?
k = Vie
1 Oo
4 2 3/4
3 8/9
Ahora consideraremos un ejemplo donde se aplicara la media y la desviacion estindar
(0 la variancia) para formar una imagen mental de la distribucién de las mediciones de
Ja cual se obtuvieron la media y la desviacion estandar.
La media y la variancia de una muestra con 1 = 25 ediciones, son 75 y 100, respectiva-
mente. Utilizar el teorema de Tchebysheff para describir la distribucién de las mediciones,
Los datos son ¥ = 75 y s* = 100, La desviaci6n esténdar es s = Vi00 = 10. La distri-
bucién se centra aproximadamente en ¥ = 75, y el teorema de Tchebyshetf afirma lo si-
guiente:
(a) Al menos 3/4 de las 25 mediciones caen en el intervalo (¢ + 2s) = [75 + 2(10)], es
decir, de 55 a 95.
(b) Al menos 8/9 de las mediciones caen en el intervalo (¥ + 3s) = [75 + 3(10)], es de-
cir, de 45a 105. 0_—_——S UU
40 CAPITULO 2. * DESCRIPCION DE CONTUNTOS DE DATOS
Jc Tchebysheff es muy conservador. Se puede aplicar a cualquier distri Dy,
1a inferior para la fraccién de mediciones A,
mayor(a de los casos, la verdadera frace
El tcorem:
cidn de mediciones y proporciona una
cacn dento de un intervalo especifico. Bn
sera mucho mas grande que (1 ~ 1/k?)
El examen de muchos conjuntos de datos sugiere una regia empirica que sirve er
Snterpretacién de una desviacidn estandar, Describe exactamente la variabilidad de
distribucién particular con forma de campana o acampanada (véase la Figura 2.10), come
cida como distribucién normal y que se discutira en detalle en el Capitulo 4. Pero tarnbie
proporciona una descripcién excelente de la variacién de muchos otros tipos de datos ar
poseen distribuciones de frecuencias relativas con forma de pico de montafia. Por tal o
76n se la Hama Regla Empiriea (de la distribucién normal) f
Frecuencia relativa
FIGURA 2.10 La distribucién normal
LA _REGLA EMPIRICA |
Dada una distribucién de mediciones que tiene aproximadamente el perfil o forms
acampanada (véase la Figura 2.10): |
=
1._El intervalo (y + 0) contendra aproximadamente 68% de las mediciones.
2. El intervalo (4 + 20) contendré aproximadamente 95% de las mediciones.
3._El intervalo (4 + 30) contendr casi la totalidad de las mediciones
LO 2.5 Se realiz6 un estudio de tiempo para determinar el tiempo necesario para efectuar una a
raci6n especifica en una fabrica o planta manufacturera. El tiempo (en minutos) neces.
para efectuar la operacién completa se midié para cada uno de n = 40 trabajadores.
media y Ja desviacién estandar fueron iguales a 12.8 y 1.7 minutos, respectivamente.
criba los datos.
JCION Para describir los datos, calculamos los intervalos:
Fes = 128417 obien Ita 14s
Ka 2s = 1284217) obien 94a 16.2
Fry = 128437) obien 7.7 a 17.941
2.7. © Signifieado Fractico de la Desviacién Estindar
Aunque no tenemos informacidn anterior acerca de la distribucién de los datos, hay
una buena posibilidad de que tendra forma de campana y que la Regla Empirica dard una
descripcidn aceptable de los datos. Segiin la citada regla es de esperar que aproximada-
mente 689% de los datos estén en el intervalo de 11.1 a 14.5; aproximadamente 95%, en
el intervalo de 9.4 a 16.2, y casi la totalidad de los datos en el de 7.7 a 17.9.
Si no estamos seguros de si la distribucién de las mediciones tiene forma de pico de
montafa, o si por alguna razén, se desea ser conservador, entonces puede aplicarse el teo-
rema de Tchebysheff y estar absolutamente seguro de nuestras afirmaciones. El teorema
de Tchebysheff dice que al menos 3/4 de las mediciones caerdn en el intervalo de 9.4 a
16.2, y al menos 8/9, en el de 7.7 a 17.9. a
Qué tan bien se aplica la Regla Empirica a los datos de rendimientos de la Tabla 2.3?
Se vera en la Seccién 2.8 que la media y la desviacién esténdar para n = 25 mediciones
son € = 3.57 y s = 0.81, Se calcularon los intervalos apropiados, y se registré el ntimero
de mediciones que caen en cada intervalo. [Link] se muestran en la Tabla 2.13, ||/
con k en la primera columna y el intervald (+ + ks) len la segunda columna, utilizando >|
¥ = 3.57 ys = 0.81. La frecuencia o el mimero-de miediciones que caen en cada intervalo
se tiene en la tercera columna, y la frecuencia relativa, en la cuarta. Notese que las fre-
cuencias relativas observadas concuerdan con el teorema de Tchebysheff y que estan rela-
tivamente cerca de las frecuencias relativas especificadas por la Regla Empirica.
Otra manera de ver qué tan bien puede aplicarse la Regla Empirica y el teorema de
Tchebysheff a los datos del rendimiento de dividendos es marcar los intervalos (X + 5),
(% + 2s) y (¥ + 3s) en el histograma de frecuencias relativas para los datos, como se muestra
en la Figura 2.11. Ahora recuérdese que el drea bajo el perfil del histograma sobre un in.
6/25
5/25
4ps
372s
Frecuencia relativa
2125
125
-/-—___
Rendimiento de dividendos
FIGURA 2.11 Histograma para los datos del rendimiento de dividendos (Figura 2.1) con los intervalos f + 5, ¥ + 2s y $+ 3s
SobrepuestosCAPITULO 2 # DESCRIPCION DE CONJUNTOS DE DATOS
te
sualmente la proporcidn del area por encima del intervalo (x + 3). Se vera que esta
0, ¢s proporcional al mimero de mediciones que caen en cl intervalo; apréciese y
Pr
porcidn esta cerca del 0.68 especificado por la Regla Empirica. Similarmente, se nota
que casi toda el area se encuentra por encima del intervalo x + 25. Claramente, la Rey
Empitica y el teorema de Tchebysheff, utilizando X y s, procuran una buena descripcig
para los datos del rendimiento de dividendos.
TABLA 2.13. Frecuencia de las mediciones que se encuentran dentro de k desviaciones estindares respecio de la media, pa
los datos de la Tabla 2.3 .
Intervalo, Frecuencia Frecuencia
k itks en interyalo relativa
1 2.76-4,38 7 68
2 195-519 4 96
3 1.14-6.00 25 1.00
'
Para coneluir, nétese que el teorema de Tchebysheff es un hecho que se puede deme
trar matematicamente, y que se aplica a cualquier conjunto de datos. Proporciona uy
cota inferior para la fraccién de mediciones que se pueden encontrar en un inter:
(¥ +s), donde k es un mimero mayor que o igual a uno. Al contrario, la Regla Empi
‘ca es una afirmacion arbitraria acerca del comportamiento dv: los datos. Aunque los
| centajes contenidos en la regla vienen del érea bajo la curva normal (Figura 2.10), los
| mos porcentajes son validos aproximadamente para
Pd
m
listribuciones con forma diferen:
mientras que tienden a tener forma de pico de montaiia (0 sea, los datos tienden a acum,
"Yarse cerca del centro de la distribucién). Hemos visto que la regla es valida para los day
del rendimiento de dividendos. Si se necesita estar mas convencido, calctilese ¥ y s
pa
un conjunto de datos que se escoja y verifiquese la fraccién de mediciones que caen |
los intervalos (¥ + s), (¥ + 2s) y (¥ + 35). Creemos que se encontrar que las frecues
ni
relativas observadas estan razonablemente cerca de los valores especificados por la a
Empirica.
EJERCICIOS TECNICAS BASICAS
@
@&
2.4
2.25
2.26
Dadas n = 5 mediciones: 0, 5, 1, 1, 3, determine lo que sigue:
(a) % (b) m @s
Dadas n = 8 mediciones: 3, 1, 5, 6, 4, 4, 3, 5, determine lo siguiente:
(az (b) m os
Dadas n = 10 mediciones: 3, 5, 4, 6, 10, 5, 6, 9, 2, 8, halle lo siguiente:
(az (b) m @s
Dadas n = 6 mediciones: 3, 0, 2, 2,1, 4, halle lo
(a) z (b) m os
Dadas n = $ mediciones: 2, 4, 0, 3, 1, encuentre lo siguiente:
(az wm ws
‘Supéngase que quiere crear una representacién mental del histograma de frecuencias relativas
tun gran conjunto de datos, que consiste en 1000 observaciones, y que se sabe que la media y lt
viacin estdndar son 36 y 3, respectivamente,
|