0% encontró este documento útil (0 votos)
3 vistas55 páginas

Esta Fun

El documento aborda las medidas de forma, incluyendo momentos y coeficientes de sesgo, definiendo momentos de orden r y su relación con la media y la varianza. Se discuten conceptos de sesgo, incluyendo el sesgo positivo y negativo, así como los coeficientes de Pearson para medir la asimetría de distribuciones. También se introduce la curtosis, que mide el apuntamiento de una distribución, y se presentan fórmulas para calcular medidas de tendencia central como la media, mediana y moda en datos agrupados y no agrupados.

Cargado por

Andy Hernández
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas55 páginas

Esta Fun

El documento aborda las medidas de forma, incluyendo momentos y coeficientes de sesgo, definiendo momentos de orden r y su relación con la media y la varianza. Se discuten conceptos de sesgo, incluyendo el sesgo positivo y negativo, así como los coeficientes de Pearson para medir la asimetría de distribuciones. También se introduce la curtosis, que mide el apuntamiento de una distribución, y se presentan fórmulas para calcular medidas de tendencia central como la media, mediana y moda en datos agrupados y no agrupados.

Cargado por

Andy Hernández
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

4.

MEDIDAS DE FORMA (MOMENTOS Y COEFICIENTES DE


SESGO)
4.1. MOMENTOS.
Si X1, X2,..........XN son los valores que toma la variable X, se define la
cantidad:
(1)
n

x + x + ....... + x
r r r x
j =1
r
j
x r

x =
r 1 2
= n
=
n n n

Como el momento de orden r. El momento de primer orden r=1 es la media


aritmética.

EL MOMENTO DE ORDEN r RESPECTO A LA MEDIA SE DEFINE COMO:

n −
 (xj =1
j − x) r
 ( x − x)

r

mr = = = ( x − x) r
n n
(2)

Si r=1, m1=0
Si r=2, m2=s^2 (varianza)

El momento de orden r con respecto a un punto cualquiera A se define como:

 (x
j =1
j − A) r
 ( x − A) r
d r

mr = = = = ( X − A) r
n n n
(3)

Donde d= X-A “Son las desviaciones de A, si A=0, (3) se reduce a (1). Se


llama también momento orden r respecto al origen.

Para datos agrupados los factores son multiplicados por “f” en cada
caso.

4.2. SESGO. Es el grado de asimetría ó falta de simetría de una distribución. Si la


curva de frecuencia tiene una “cola” más larga a la derecha del máximo central
que a la izquierda, se dice que la distribución esta sesgada a la derecha ó que
tiene “sesgo positivo”, si es a la izquierda se dice que tiene “sesgo
negativo”.

- 14 -
4.2.1. PRIMER COEFICIENTE DE PEARSON. En distribuciones sesgadas, la
media tiende a situarse con respecto a la moda al mismo lado que la cola

55.15 − 52.75
x − Mo sesgo = = 0.15533
sesgo = 15.4515
s
más larga. Así una medida de la asimetría nos dada por la diferencia
(Media-Moda) y se adimensiona dividiéndola por una medida de dispersión.

4.2.2. SEGUNDO COEFICIENTE DE PEARSON. Para evitar el empleo de la


moda, se puede usar
la fórmula empírica ([Link] de la pagina 7) así:


3( x − Me) 3(55.15 − 54.54)
sesgo = sesgo = = 0.1177
s 15.4515

4.2.2. COEFICIENTE DE SESGO USANDO EL MOMENTO DE ORDEN TRES


CON RESPECTO A LA MEDIA. En este momento nos va a ser útil la hoja
de cálculo que venimos usando para datos agrupados agregando lo
siguiente:

limites discretos limites reales f xi F fxi


x-x f(x-x) ^2 f^2 ^3 f^3 ^4 f^4
21 29 20.5 29.5 4 25 4 100
-30.15 -120.6 909.0225 3636.09 -27407.0284 -109628.114 826321.906 3305287.62
30 38 29.5 38.5 12 34 16 408
-21.15 -253.8 447.3225 5367.87 -9460.87088 -113530.451 200097.419 2401169.03
39 47 38.5 47.5 16 43 32 688
-12.15 -194.4 147.6225 2361.96 -1793.61338 -28697.814 21792.4025 348678.44
48 56 47.5 56.5 23 52 55 1196
-3.15 -72.45 9.9225 228.2175 -31.255875 -718.885125 98.4560062 2264.48814
57 65 56.5 65.5 18 61 73 10985.85 105.3 34.2225 616.005 200.201625 3603.62925 1171.17951 21081.2311
66 74 65.5 74.5 15 70 88 1050
14.85 222.75 220.5225 3307.8375 3274.75913 49121.3869 48630.173 729452.595
75 83 74.5 83.5 9 79 97 711
23.85 214.65 568.8225 5119.4025 13566.4166 122097.75 323559.037 2912031.33
84 92 83.5 92.5 3 88 100 264
32.85 98.55 1079.123 3237.3675 35449.1741 106347.522 1164505.37 3493516.11
0 0 0
AMPLITUD 9 TOTAL100 465 5515 10.8 1184 3416.58 23874.75 13797.783 28595.025 2586175.94 13213480.8

28595.025
m 100
coeficient e sesgo = a3 = 33 = = 0.0775
s 15.45 3

[Link]. COEFICIENTE b1

b1 = a32 = 0.0775 2 = 0.006

- 15 -
4.2.3. CURTOSIS. Es el grado de apuntamiento de una distribución,
normalmente se toma en relación a una normal. Una distribución que
presenta un apuntamiento relativo alto, se le llama: leptocúrtica, mientras
que la curva que es más achatada se llama platicúrtica. La distribución
normal se llama: mesocúrtica.

La curtosis más utilizada es la que utiliza el momento de cuarto orden con


respecto a la media expresado en forma adimensional, así:

m4
curtosis = a 4 =
s4

13213480.8
a4 = 100 = 2.318
15.45 4

Al coeficiente a4 se le denomina como b2. Para una distribución normal, b2= 3.


Muchas veces la curtosis se designa como (b2-3), el cuál es positiva para una
distribución leptocúrtica, negativa para una platicúrtica y 0 para una mesocúrtica.

A4 = 2.318 – 3 = -0.6818

- 16 -
2. MEDIDAS DE POSICION
2.1. DATOS NO AGRUPADOS. Se utiliza para analizar poblaciones ó muestras pequeñas,
generalmente cuando tienen 30 ó menos elementos.

2.1.1. MEDIDAS DE TENDENCIA CENTRAL. Son medidas que describen el centro de una
distribución, que es donde se localizan la mayor parte de los datos (caso típico en la
distribución normal).

[Link].MEDIA ARITMETICA. Es el valor equidistante entre el grupo de mayor valor y el punto


de menor valor de una serie de datos, la forma de calcularla es la siguiente:

 xi
x= i =1

Propiedades de la media aritmética.


a) Unicidad: solo existe una media en una serie de datos.
b) Simplicidad: es fácil de calcular y comprender.
c) La suma algebraica de las desviaciones de una serie de datos con respecto a su media


 ( xi − x) = 0
aritmética es cero. Desviación = (xi-x).
d) si en una serie de datos estos aparecen multiplicados por un valor K, la media nueva será
la
media anterior multiplicada por la constante.
e) Si en una serie de datos estos aparecen sumados por un valor h constante, la media
nueva
será la media anterior más h.

Ejemplo 1. Con los datos siguientes calcular la media: 2, 10, 4, 6, 9, 7, 5, 12


Datos ordenados: 2, 4, 5, 6, 7, 9, 10, 12
Sumatoria: 55
Numero de datos: 8
− 55
x=
8
Media = 6.875

[Link]. MEDIA PONDERADA. Suponga que en una tienda se venden 3 marcas de jugo de
naranja a Q. 4.10, 4.20, y 4.30 y que en un día cualquiera se vendieron latas de los tres
precios. El precio medio de venta por lata sería: 4.20. A primera vista parecería que el
valor es bastante representativo pero si además se sabe que se vendieron 23 latas de
4.20, 72 latas de 4.10 y 5 latas de 4.30 el precio medio de lata vendida en ese día sería:

(23 x 4.20) + (72 x 4.10) + (5 x 4.30)


23 + 72 +5
Media ponderada = 4.13

-6-
Definición: Sea dado un conjunto de datos, tales como x1, x2, x3,.......xn y un conjunto de
valores p1, p2, p3,........pn, asociados con cada observación xi respectivamente, que reciben
el nombre de factores de ponderación. Luego la media ponderada se define como:
− n
xiPi
xp=
i =1  Pi
[Link]. LA MEDIANA. Es el valor que divide en dos partes iguales a una serie de datos finitos.
Para encontrar la mediana es necesario ordenar los datos, y pueden ocurrir dos casos:
a) que el número de datos sea impar: la mediana será el valor central de la serie.
Ejemplo: 3, 5, 8, 12, 25 La mediana es 8.
b) que el número de datos sea par: Entonces la mediana será la media aritmética de los valores
centrales. Ejemplo: 2, 4, 7, 25, 39, 47 La mediana es 16 ó sea la media de 7 y 25.

[Link]. LA MODA. Es el valor que ocurre con más frecuencia en una serie de datos. Ej: 1, 5,
6, 6, 7, 8, 9 La moda es igual a 6. En algunas series como 1, 2, 3, 4, 5, 7, 8 no existe
moda y la distribución se denomina: amodal, hay algunas otras series donde existen
más de una moda y la distribución entonces toma el nombre de Bimodal, Trimodal, etc.
Según sea el caso.

2.2. DATOS AGRUPADOS.


Cuando la cantidad de datos es grande, es conveniente agrupar los datos en distribuciones de
frecuencias según vimos en la unidad 1.

Tabla 3. Hoja de Cálculo para Medidas de Posición. Productividad 100 Trabajadores, Piezas
Aceptables

limites discretos limites reales f xi F fxi


21 29 20.5 29.5 4 25 4 100
30 38 29.5 38.5 12 34 16 408
39 47 38.5 47.5 16 43 32 688
48 56 47.5 56.5 23 52 55 1196
57 65 56.5 65.5 18 61 73 1098
66 74 65.5 74.5 15 70 88 1050
75 83 74.5 83.5 9 79 97 711
84 92 83.5 92.5 3 88 100 264

AMPLITUD 9 TOTAL 100 465 5515

f = Frecuencia simple.
F = Frecuencia acumulada
Xi = Marca Clase (punto medio de la clase)
fxi = Frecuencia simple

-7-
2.2.1. MEDIDAS DE TENDENCIA CENTRAL.

[Link]. MEDIA Ó PROMEDIO. Al presentarse los datos en una tabla de frecuencia, no es


posible conocer los valores de cada una de las observaciones, pero sí las categorías
en las cuales se hallan. Para poder calcula la media, se supondrá que dentro de cada
categoría, las observaciones se distribuyen uniformemente alrededor del punto medio
de la clase.

El cálculo de la media se realiza mediante la siguiente fórmula:

−  fxi n

 fxi
x= i =1 −
n
x= i =1

i =1
fi n

Según la distribución de frecuencias de la tabla 3 el cálculo de la media sería:

− 5515
x= = 55.15
100

[Link]. MEDIANA. Para su calculo se utiliza la siguiente fórmula:


(n / 2 − fa)
Me = Li + c
f
Li = límite real inferior de la clase mediana.
n = número de datos, ó sumatoria de frecuencias
fa = frecuencias acumulada anterior a la clase mediana
f = frecuencia de la clase mediana
La clase mediana se determina por n/2 y observando la frecuencia acumulada.
Continuando con el ejemplo anterior

(100 / 2 − 32)
Me = 47.5 + 9
23

Mediana = 54.54

-8-
[Link] MODA Para su calculo se utiliza la siguiente fórmula.

(d1)
Mo = Li + c
d1 + d 2

Donde: Li= límite real inferior de la clase modal.


d1= frecuencia de la clase modal menos frecuencia anterior
d2= frecuencia de la clase modal menos frecuencia posterior
c = amplitud de clase

La “clase modal” es la clase que tiene la más alta frecuencia, en el ejemplo que estamos
desarrollando sería 48-56 que tiene una frecuencia de 23, su calculo sería así:

d1= 23-16 = 7
d2= 23-18=5
(7 )
Mo = 47.5 + 9
(7 + 5)

Moda= 52.75

[Link]. RELACION EMPIRICA ENTRE MEDIANA Y MODA.


− −
x − Mo = 3( x − Md )

− −
Mo = x − 3( x − Md )

Mo = 55.15 − 3(55.15 − 54.54)

Moda= 53.32 (un valor aproximado al calculado anteriormente)

2.2.2. CUANTILES Son medidas de posición que sitúan valores a diferentes puntos de la
distribución, los más utilizados son los quartiles, los deciles y los percentiles.

[Link]. QUARTILES: Dividen la distribución en cuatro partes iguales, Q1, Q2, Q3


Qj; j = 1, 2, 3
(nj / 4 − fa)
Qj = Li + c
f
Ejemplo:
((100 *1) / 4) − 19
Q1 = 38.5 + 9
10

Q1= 43.5625

-9–
[Link]. DECILES: Dividen la distribución en diez partes iguales:
D1,D2,D3,D4,D,5,D6,D7,D8,D9

Dj; j= 1, 2, 3, 4, 5, 6, 7, 8, y 9

Ejemplo:
(nj / 10 − fa)
Dj = Li + c
f
((100 * 8) / 10) − 73
D8 = 65.5 + 9 = 69.7
15

[Link]. PERCENTILES: Dividen la distribución en cien partes iguales: P1,p2.......P99


Pj: j= 1, 2, 3..........99

(nj / 100 − fa)


Pj = Li + c
f
((100 * 85) / 100) − 73
p85 = 65.5 + 9
15

P85= 72.7

- 10 -
DISTRIBUCION DE POISSON

INTRODUCCION: La probabilidad de Poisson es otra distribución de probabilidad discreta y tiene muchas


aplicaciones prácticas como por Ej.
- Número de llamadas por hora que llegan al conmutador de una estación de policía.
- Número de llegadas de carros al día en un puente de peaje.
- Número de huelgas industriales importantes al año en el Reino Unido.
- Número de manchas en una yarda cuadrada de tela.
- Número de defectos por lote en un proceso de producción.

Se usa para modelar situaciones en las que el número de pruebas es muy grande y el número de
éxitos es muy pequeño.

Un proceso de Poisson existe si podemos observar eventos discretos en un área de oportunidad, un intervalo
continuo (de tiempo, longitud, área, etc.) de tal manera que si acortamos el área de oportunidad ó intervalo de
manera suficiente:
1) La probabilidad de observar exactamente un éxito en el intervalo es estable.
2) La probabilidad de observar exactamente más de un éxito en el intervalo es 0.
3) La ocurrencia de un éxito en cualquier intervalo es estadísticamente independiente de aquella en
cualquier otro intervalo.

Supongamos que examinamos el número de clientes que llegan durante la hora del almuerzo de 12 a 1 PM en
un banco localizado en el distrito comercial central de una ciudad grande. Cualquier llegada de un cliente es
un evento discreto en un punto particular sobre el intervalo continuo de una hora. Durante tal intervalo de
tiempo puede haber un promedio de 180 llegadas. Ahora, si tuviéramos que dividir el intervalo de una hora
en 3600 intervalo consecutivos de un segundo.
1) El número (o promedio) esperado de clientes que llegan en cualquier intervalo de segundos sería 0.05.
2) La probabilidad de que más de un cliente llegue en cualquier intervalo de un segundo es 0.
3) La llegada de un cliente en cualquier intervalo de un segundo no tiene efecto sobre (es decir, es
estadísticamente independiente de la) llegada de cualquier otro cliente en cualquier otro intervalo de un
segundo.

EL MODELO MATEMATICO. La expresión matemática para la distribución de Poisson para obtener X


éxitos, dado que se esperan  éxitos es.

e − x
P( X = x ) =
x!
Donde:
P(X= x ) = Probabilidad de X= x dado que se conoce .
 = número esperado de éxitos.
e = constante matemática aproximada por 2.71828
x = número de éxitos por unidad.

Observe que solo se necesita una medida para calcular la probabilidad de un valor dado de x:  ( número
esperado de éxitos).

CARACTERISTICAS.
FORMA: Cada vez que se especifica el parámetro  puede generarse una distribución de probabilidad de
Poisson específica. Una distribución de Poisson estará sesgada a la derecha cuando  es pequeña, y se
aproxima a la simetría (con un pico al centro) al crecer .

LA MEDIA Y LA DESVIACION ESTANDAR. Una propiedad interesante de la distribución de Poisson es


que la media  y la varianza  son iguales al parámetro .
Por Samuel Reyes
EJEMPLO 1. Regresando al ejemplo que estamos manejando,  = 0.05 clientes llegan por segundo ¿Cuál es
la probabilidad de que en un minuto dado lleguen exactamente dos clientes?.

Para resolver debemos convertir los segundos en minutos. Llegadas por minuto = (0.05) 60 = 3
Usando la ecuación tenemos:

e−3 (3.0) 9
P(2) = = = 0.2240
2! (2.71828)3 (2)
EJEMPLO 2.
Un problema que enfrenta Central Motor se refiere a la centralita de teléfonos de la oficina principal. El
número de personas que operan la centralita varía mucho durante el día, aun cuando el número de llamadas
que entra permanece constante durante todo el día. Después de verificar la aleatoriedad, el gerente decide que
las llamadas sin duda son aleatorias. No parece haber ciertas horas en el día en que entren más llamadas que
en otras y no parece haber ningún patrón. La gerencia decide que la unidad de tiempo a evaluar será un
intervalo de cinco minutos. Para usar la distribución de Poisson el analista de la central debe calcular la
media, o el número promedio de ocurrencias por intervalo de cinco minutos durante el día de trabajo. Se
seleccionan varios intervalos de cinco minutos al azar durante la siguiente semana. Se encuentra que el
número promedio de llamadas durante ese intervalo es 4.8. Este valor es la media de la distribución de
Poisson que se usa para calcular las probabilidades.

La distribución de Poisson se ha resuelto para cientos de valores se ha compilado en tablas, como las que se
distribuyeron en clase. Los resultados por esta vía sería:

X P(x)
0 0.0082
1 0.0395
2 0.0948
3 0.1517
4 0.1820
5 0.1747
6 0.1398
7 0.0959
8 0.0575
9 0.0307
La representación gráfica sería:

P(x)

0.2
0.18
0.16
0.14
0.12
0.1 P(x)
0.08
0.06
0.04
0.02
0
0 2 4 6 8 10

Por: Samuel Reyes


APROXIMACION DE POISSON A LA BINOMIAL. En problemas de distribución Binomial donde n es
grande y la probabilidad de éxito (p) es bastante pequeña o bastante grande, las probabilidades se pueden
aproximar usando la distribución de Poisson. En este método se supone que las ocurrencias de éxitos de la
Binomial siguen un proceso de Poisson. Aunque las probabilidades calculadas usando esta aproximación no
son exactas, son bastante cercanas a las probabilidades binomiales verdaderas.

La fórmula quedaría de la siguiente forma:

e − np (np) x
p ( x) =
x!

Y se operaría normalmente con la ecuación para la distribución de Poisson ó haciendo uso de la tabla.

Ejemplo. Calcular la probabilidad de obtener exactamente una llanta defectuosa de una muestra de 20 si 8%
de las llantas fabricadas en una planta particular son defectuosas.
n = 20
P = 0.08
np = 1.6
De la tabla: p (1) con np= 1.6 = () . P (1) = 0.3230

Si se hubiera empleado la verdadera distribución, la Binomial en vez de la aproximación, calcularíamos:

P (1) Binomial con x = 20 y p= 0.08 = 0.3282.


EJEMPLO DE PROBABILIDAD BINOMIAL

El gerente de una tienda estima que la probabilidad de que cualquier cliente compre es de
0.30. ¿Cuál es la probabilidad de que dos de los siguientes tres clientes hagan una compra?

3 3!
p( X )= 3 C 2 0.32 (0.7) 3−2 = ( )0.32 (0.7) 3−2 = 0.32 0.7 3−2
2 2!(3 − 2)!

Resultado = 0.189

Si consideramos variantes del experimento, como 10 clientes, en lugar de 3, que entran al


almacén, la función de probabilidad binomial se sigue aplicando de acuerdo con la
ecuación. Ejemplo la probabilidad de efectuar exactamente cuatro ventas a 10 clientes
potenciales que entran a la tienda es:

10 10!
p( X )=10 C4 0.34 (0.7)10− 4 = ( )0.34 (0.7)10− 4 = 0.340.7 6
4 4!(10 − 4)!
Resultado = 0.2001.

Supongamos que para el mes próximo se pronostica que 1000 clientes entren a la tienda.
¿cuál es la cantidad esperada de clientes que harán una compra?

E (x) = np = (1000) (0.3) = 300.

Para aumentar la cantidad esperada de ventas debe inducirse a más clientes para que entren
a la tienda.
EJERCICIOS DE PROBABILIDADES

1. De 62 estudiantes, 18 trabajan en instituciones gubernamentales, 30 en empresas


privadas y 10 a tiempo parcial en ambos tipos. Determinar la probabilidad de que
trabajen en el gobierno, en lo privado ó a medio tiempo.

P = 18/62 + 30/62 – 10/62 = 38/62 = 19/31

2. Si se extraen sucesivamente dos bolas de una caja que contiene 5 bolas blancas y 3
bolas rojas. Cual es la probabilidad de que las bolas obtenidas sean blancas si:
a) se reemplaza la 1ª. Bola.
b) No se reemplaza.

a) p = 5/8 * 5/8 = 25/64


b) p = 5/8 * 4/7 = 20/56 = 5/14

3. a) Cual es la probabilidad de extraer un as de una carta de un naipe.


p = 4/52 = 1/13.
b) Cual es la probabilidad de extraer una carta de corazones en un naipe.
P = 13/52 = ¼
c) Cual es la probabilidad de extraer un as ò un rey en una sola extracción en un
naipe. p (A ó B) = P (A) + p (B) = 4/52 + 4/52 = 8/52 = 2/13
d) Cuál es la probabilidad de extraer un as, ó una carta de corazones ó el as de
corazones. P (A ó B) = 1/13 + ¼ - 1/52 = 16/52 = 4/13

4. Una empresa elabora repuestos y fabrica diez en total diariamente distribuidos así:
tres repuestos de motor, 5 repuestos eléctricos y dos para frenos. Si se seleccionan
sucesivamente tres repuestos al azar sin reemplazarlos hallar las probabilidades
siguientes:
[Link] sean dos de motor y uno de frenos.
P (A) = 3/10 * 2/9 * 2/8 = 12/720 = 1/60
[Link] sean dos de frenos y uno eléctrico.
P (A) = 2/10 * 1/9 * 5/8 = 10/720 = 1/72
[Link] al menos dos sean de motor.
P (A) = 3/10 * 2/9 * 1/8 = 6/720 = 1/120 tres piezas motor.
P (B) = 3/10 * 2/9 * 7/8 = 42/720 = 7/120 dos piezas de motor ó 1 cualquiera.
P (A) + P (B) = = 1/120 + 7/120 = 8 /120 = 4/60 = 1/15
d. Que tres piezas sean de motor.
P (A) = 3/10 * 2/9 * 1/8 = 6/720 = 1/120.
e. Que sean uno de cada tipo.
P (A) = 3/10 * 5/9 * 2/8 = 30/720 = 3/72 = 1/24
REGLAS DE CONTEO

Primero que nada suponga que una moneda se ha lanzado al aire 10 veces ¿Cómo
determinaríamos el número de diferentes resultados posibles (las secuencias de caras y
escudos)

Regla de conteo I: Si cualquiera de k eventos mutuamente excluyentes y colectivamente


exhaustivos puede ocurrir en cada uno de n intentos, el número de resultados posibles es
igual a:
kⁿ

Si una moneda (con dos lados) se arroja 10 veces, el número de resultados es 2¹º = 1024. Si
un dado (con seis lados) se lanza dos veces, el número de resultados es 6² = 36. La segunda
regla de conteo es una versión más general de la primera. Para ilustrar esta regla, suponga
que el número de eventos posibles es diferente en algunos de los intentos. Por ejemplo, una
ofician estatal de vehículos automotores desearía saber de cuantos números de placas
policíacas se dispondría si la placa consistiera en tres letras seguidas de tres dígitos. El
hecho que tres valores sean letras (cada una con 26 resultados posibles) y tres posiciones
sean dígitos (cada uno con 10 resultados) lleva a la segunda regla de conteo.

Regla de conteo 2: Si hay k , eventos del primer intento, k2 eventos del segundo intento,...
y kn eventos del n ésimo intento, entonces el número de resultados posibles es

(k1)(k2)..... (kn)

Por lo tanto, si una placa policíaca consistiera de tres letras seguidas de tres dígitos,
el número total de resultados posibles sería entonces (26)(26)(26)(10)(10)(10) =
17,576,000. Tomando otro ejemplo, si un menú de restauran tuviera una cena completa de
precio fijo que consistiera en un aperitivo, entrada, bebida, y postre y hubiera la opción de
cinco aperitivos, diez entradas, tres bebidas y seis postres, el número total de cenas posibles
sería (5)(10)(3)(6) = 900.

La tercera regla de conteo involucra el cálculo del número de formas que un


conjunto de objetos puede ordenarse. Si un conjunto de seis libros de texto se tienen que
colocar sobre una repisas, ¿cómo podemos determinar el número de formas en que los seis
libros pueden acomodarse? Podemos comenzar dándonos cuenta que cualquiera de los seis
libros podría ocupar la primera posición en la repisa. Una vez que se llena la primera
posición, hay cinco libros por escoger para llenar la segunda. Este procedimiento de
asignación se continúa hasta que se ocupen todas las posiciones. Esta situación puede
generalizarse como la regla de conteo 3.

Regla de conteo 3: el número de formas en que los n objetos pueden ordenarse es:
n!= n (n-1).....(1)

El número de formas en que los seis libros pueden ordenarse es:


n!= 6! = (6)(5)(4)(3)(2)(1)= 720
En muchos casos necesitamos saber el número de formas en que un subconjunto del
grupo completo, puede ordenarse. Cada arreglo posible se llama una permutación. Por
ejemplo, modificando el problema anterior, si se tienen seis libros de texto, pero sólo hay
espacio para cuatro libros en el estante. ¿de cuántas formas se pueden acomodar estos
libros en el estante?

Regla de conteo 4. Permutaciones: el número de modos de ordenar X objetos


seleccionados de n objetos es
n!
(n − x)!

Por lo tanto, el número de arreglos ordenados de cuadro libros seleccionados de seis libros
es igual a:
n! 6! 6! (6)(5)( 4)(3)( 2)(1)
= = = = 360
(n − x)! (6 − 4)! 2! (2)(1)

Finalmente, en muchas situaciones no estamos interesados en el orden de los


resultados, sino sólo en el número de formas en que X objetos pueden seleccionarse de n
objetos, sin tomar en cuenta el orden. Esta regla se llama de combinaciones.

Regla de conteo 5. Combinaciones. El número de modos de seleccionar X objetos de n


objetos, sin tomar en cuenta el orden, es igual a:

n!
x!(n − x)!

n
Esta expresión puede denotarse mediante el símbolo.   .
 x

Comparando esta regla con la anterior, vemos que difiere sólo en la inclusión de un
termino x! en el denominador. Esto se debe a que cuando contamos permutaciones, todos
los arreglos de x objetos eran distinguibles; con las combinaciones, los x! arreglos posibles
de objetos no son importantes. Así, el número de combinaciones de cuatro libros
seleccionados de seis libros se expresa mediante:

n! 6! 6! (6)(5)( 4)(3)( 2)(1)


= = = = 15
x!(n − x)! 4!(6 − 4)! 4!2! (4)(3)( 2)(1)( 2)(1)

Tomado de Berenson.
DESARROLLO DE MINIMOS CUADRADOS PARA ANALISIS DE REGRESION

ŷ =bo+b1x
y

(x,y)


d = y− y
d = y − (bo + b1 x)
d 2 =  y − (bo + b1 x 
2

d =   y − (bo + b1 x)
2 2

=  ( y − bo − b1 x) 2

DERIVADAS PARCIALES

 
= 2 ( y − b1x − bo )( − x) = 2 ( y − b1x − bo )( −1)
b1 bo
= 2 (− xy + b1 x 2 + bo x) = 2 (− y + b1 x + bo )

PARA OBTENER MINIMOS SE IGUALA A 0 LA DERIVADA PARCIAL

2 (− xy + b1 x 2 + bo x) = 0 2 (− y + b1 x + bo ) = 0
 (− xy + b x + b x = 0
1
2
o
 (− y + b x + b = 0
1 o
−  xy + b  x + b x = 0
o 1
2
−  y + Nb + b  x = 0
o 1
PARA ENCONTRAR bo y b1 TALES QUE Σd² ES UN MINIMO

bo x + b1  x 2 =  xy X N
Nb1  x 2 − b1 ( x) 2 = N  xy −  x
Nbo + b1  x =  y X x b1 ( N  x 2 − ( x) 2 = N  xy −  x y
Nbo x + Nb1  x = N  xy
2

Nbo x + b1 ( x) 2 =  x y

Nbo + b1  x =  y
N  xy −  x y
b1 = Nbo =  y − b1  x
N  x 2 − ( x) 2
bo =
y − b x
1

N N
DISTRIBUCION DE PROBABILIDAD EXPONENCIAL

INTRODUCCIÓN: La función de probabilidad exponencial es una distribución de


probabilidad de tipo continuo, y es útil para describir el tiempo que se tarda en realizar una
actividad, por ejemplo: el tiempo necesario para cargar un camión, el tiempo entre llegadas
de un autobús, la distancia entre los principales defectos de una carretera, etc.

1
FUNCION DE DENSIDAD: f ( x) = e− x / 

Supongamos que el tiempo que se tarda en cargar un camión en un muelle sigue esa
distribución. Si la media del tiempo, o tiempo promedio para cargarlo es de 15 minutos .
Su función de densidad de probabilidad es:
1 − x / 15
f ( x) = e
15

Probabilidad para carga en muelle

0.07

0.06

0.05
probabilidad

0.04

0.03

0.02

0.01

0
0 10 20 30 40 50
tiempo de carga

FUNCION DE DISTRIBUCIÓN:
El área bajo la curva que corresponde a cierto intervalo equivale a la probabilidad de que la
variable aleatoria asuma un valor en ese intervalo. En el ejemplo anterior, la probabilidad
de que la carga de un camión dure 6 minutos ó menos se define como el área bajo la curva
de x=0 a x=6 en la gráfica de arriba. Para calcular esto utilizamos la siguiente fórmula:

p( x  xo ) = 1 − e − xo / 

Para el ejemplo anterior:

p( x  xo ) = 1 − e − xo / 15
Por tanto la probabilidad de que la carga de un camión dure seis minutos ó menos es:

p( x  xo ) = 1 − e −6 / 15 = .3297

La probabilidad de que la carga de un camión dure 18 minutos ó menos es:


p( x  xo ) = 1 − e −18 / 15 = .6988

Así la probabilidad de que la carga de un camión tarde de seis a 18 minutos es igual a:


.6988-.3297 = .3691. De este modo se pueden calcular las probabilidades para cualquier
otro intervalo.
EJERCICIO ESTADISTICA PARA EL CONTROL DE FALLAS

1) Una familia real procrea tres hijos (hombres y mujeres), establecer la probabilidad de
que cuando se necesite nombrar un nuevo rey la decisión se realice entre dos
alternativas.
2) En una carretera asfaltada se encuentran 30 baches por cada 100 kilómetros en
promedio, cuál es la probabilidad de encontrar 2 baches en 10 kilómetros.
3) La temperatura promedio de una ciudad es de 20 grados centígrados, con una varianza
de 4 grados centígrados:
i) Cual es la probabilidad de que esta ciudad tengan 20 ó menos grados
centígrados de temperatura
ii) Si el valor de x estandarizado fuera de 0, cuál sería la probabilidad de tener
menos de ese valor como temperatura en la ciudad?
iii) Cual sería el valor estandarizado (z) para una probabilidad acumulada de 0.5
partiendo desde la izquierda.
iv) Cual sería el valor de la temperatura para ese punto?
4) Un tanque de agua se llena en un promedio de 15 minutos. Cual es la probabilidad de
que ese tanque se llene en más de 6 minutos?

5) El peso de 15 estudiantes en libras es el siguiente:


80, 90, 100, 110, 120, 140, 145, 90, 99, 110, 110, 119, 100, 135, 85
a) cual es peso que más se repite en esta distribución.
b) que peso deja bajo sí el 50% de los datos?
c) alrededor de que peso equidistan todos los demás pesos?
d) La forma de la curva en sentido vertical es?

6) Con los siguientes datos buscar un modelo matemático que permita predecir el precio de
las casas en función de su número de cuartos.
Precio Número
Casa Venta cuartos
1 90.4 8
2 127.3 9
3 109.6 8
4 131.2 12
5 81.3 6
6 107.9 10
7 135.8 11
8 97.8 7
9 116.7 10
10 164.8 14
11 88.8 7
12 120.5 11
13 109.8 10
a) Existirá una buena relación entre variables?
b) El ajuste del modelo matemático es bueno?
c) Cuál será el modelo matemático?
d) Cual sería el precio de venta para una casa de 5 cuartos?
3.6. INFERENCIAS RESPECTO A LOS PARAMETROS
DE POBLACION EN REGRESION Y CORRELACION

3.6.1. INTRODUCCION. Cuando se realizan análisis de regresión y correlación es necesario contar con
cierto grado de confiabilidad de que las predicciones y las relaciones entre “X y Y” sean
estadísticamente aceptables y para ello se usa la inferencia estadística para llegar a conclusiones
acerca de la pendiente “b” y del coeficiente de correlación de la población, “r”. Analizaremos tres
tipos de pruebas para este fín.

a) Pendiente verdadera igual a cero: Podemos determinar si existe una relación significativa entre las
variables X y Y al probar si “b” (pendiente de la ecuasión lineal) es igual a cero. Si esta hipótesis es
rechazada se puede llegar a la conclusión de que existe evidencia de una relación lineal. Las hipótesis
nula y alternativa se pueden establecer de la manera siguiente:

Ho : 1 = 0 ( No hay relación )
Ha : 1  0 ( Hay relación )

Y el estadístico de prueba par a probar la hipótesis está dada por:

b1 −  1
t=
Sb1
En donde:
S yx
Sb1 = −

 x2 − n x2

Ejemplo: Con Y = 2.423 + 0.00873 X Con Y = bo + b1Xi


Para Y = o + 1Xi + Ei

Del ejemplo que hemos venido desarrollando entre el número de clientes y ventas semanales

Syx = 0.497 SST = 51.3605 SSR = 46.9145 SSE = 4.446

x = 731.15 y = 8.8055

0.497 0.497
Sb1 = = = 0.000634
11,306,209 − 20(731.15) 2
614,603

y, bajo la hipótesis nula, 1 = 0

b1 0.00873
t= = = 13.77
S1 0.000634

Regla de Decisión: Si t calculado  t tabla se rechaza la hipótesis y como 13.77  2.1009 rechazamos la
hipotesis nula y por tanto indicamos que si existe relación entre las dos variables ya que 1 no es igual a 0,
por tanto la pendiente es mayor que 0.

- 28 –
b) Establecer un intervalo de confianza para 1 y deteinar si el valor 1 (supueso igual a cero) está
incluido en este intervalo.
La estimación de intervalo de confianza se obtendría mediante la siguiente fórmula:

b1  t Sb1

Si se deseara una estimación de intervalo de confianza del 95% tendríamos b1= 0.00873, t18 = 2.1009,
Sb1 = 0.000634

1 = 0.00873  2.1009 (0.000634)


= .00873  0.00133
0.0074  1  0.01006

REGLA DE DECISION. Los valores del intevalo de 1 están por arriba de 0, esto hace concluir que
existe relación lineal significativa, por tanto podemos llegar a la conclusión de que existe una relación
lineal significativa entre las ventas semanales y el número de clientes.

Si el intervalo hubiera incluído el cedro no se hubiera determinado relación.

c) Determinar si existe alguna correlación significativa entre las variables haciendo la Hipótesis que el
coeficiente de correlación de la población “p”

Es igual a cero: Ho : p = 0 (no hay correlación)


H1 : p  0 ( hay correlación )

El estadístico dce prueba para determinar la existencia de una correlación significativa esta dada por:

r−p
t=
1− r2
n−2
En el ejemplo de los almacenes:

0.956 0.956
t = = = 13.75
1 − 0.913 0.0695
20 − 2

El t de student de la tabla con n-2 gl y a un 95% = 2.1009

Regla de decisión: Si t calculado es mayor que el t de la tabla se rechaza la hipótesis nula.

13.75  2.1009 Se rechaza la hipótesis nula

Se concluye que si existe correlación.

- 29 -
3.7. MODELO DE REGRESION MULTIPLE.

3.7.1. INTRODUCCION.

Algunas veces se dá el caso de que se puede desarrollar un modelo que se ajusta mejor si se toma en cuenta
más de una variable explicatoria en cuyo caso estaríamos desarrollando un modelo de Regresión multiple.

3.7.2. DESARROLLO.

En un análisis de correlación multiple se pueden tomar en consideración muchas variables explicatorias para
simplificar consideraremos solamente dos, con estos datos podemos construir una grafica tridimensional
(diagrama de dispersión).

El modelo de regresión lineal multiple pude expresarse así:

Y = o + 1X1i + 2 X2i + 3X3i +........... + pXpi + ei


En la que:
o = Intersección con el eje Y
1 = Pendiente de Y respecto a la variable X1, manteniendo constantes X2, X3,....Xp
2 = Pendiente de Y respecto a la variable X2, manteniendo constantes X1, X3,....Xp
p = Pendiente de Y respecto a la variable Xp, manteniendo constante X1, X2,...Xp-1
ei = error aleatorio en Y correspondiente a la observación i.

3D Surface Plot ([Link] 10v*10c)


z=86.255+8.324*x+0.288*y

115.375
120.75
126.126
131.501
136.876
142.251
147.626
153.002
158.377
163.752
above

- 30 -
Ejemplo: Amy Green presidenta de la compañía Green Garden quiere ver si el volumen semanal de ventas de
su empresa se relaciona con algunas variables. Primero con una regresión simple relaciona las ventas con el
número de anuncios semanales en televisión de la compañía, con esto explica el 91.3 % de la varianza en las
ventas a través de la relación lineal ( r = 0.956 ) , para reducir la varianza debida al error analiza la
temperatura promedio semanal como otra variable los resultados son:

y x1 x2 Y x1 X2 yx1 yx2 x1x2


125 3 41 15625 9 1681 375 5125 123
152 5 86 23104 25 7396 760 13072 430
131 4 33 17161 16 1089 524 4323 132
133 4 47 17689 16 2209 532 6251 188
142 5 64 20164 25 4096 710 9088 320
116 3 22 13456 9 484 348 2552 66
127 3 55 16129 9 3025 381 6985 165
163 6 84 26569 36 7056 978 13692 504
1089 33 432 149897 145 27036 4608 61088 1928

Las ecuasiones normales serían:


y = nbo + b1x1 + b2 X2
x1y= box 1+ b1x1 + b2 X1X2
x2y= boX2 + b1 x1x2 + b2 x2

1089 = 8 bo + b1 33 + b2 432
4608 = bo 33 + b1 145 + b2 1928
61088 = bo 432+ b1 1928 + b2 27036

Resolviendo este sistema de ecuaciones de tres incógnitas tendremos que:

bo = 86.255 b1 = 8.324 y b2 = 0.2877

y el modelo de regresión quedaría así:

y = 86.255 + 8.324 X1 + 0.2877 X2

Con este modelo nosotros podemos ya predecir, por ejemplo si queremos predecir las ventas semanales
especificando que el número de comerciales es de 4 (X1) y la temperatura ambiental promedio de la semana
es de 70 (X2).

El pronóstico de ventas semanales es:

y = 86.255 + 8.324 (4) + 0.2877 (70)


y = 139.688 (miles de dólares)

¿Cómo afectaría a las ventas el aumento de un comercial a la semana si la temperatura ambiental promedio se
mantuviera constante?

y = 86.255 + 8.324 (5) + 0.2877 (70)


y = 148.012 (miles de dólares )

- 31 -
TEORIA ELEMENTAL DE PROBABILIDADES
Por: Samuel Reyes
[Link].
La teoría de la probabilidad proporciona la base para la inferencia estadística, debido a que la estadística
inferencial, tiene entre sus objetivos “cuantificar la incertidumbre que caracteriza a todo proceso en el que se
avanza de lo particular a lo general”. La probabilidad es la posibilidad u oportunidad de que suceda un evento
particular.

[Link] DE ASIGNAR PROBABILIDADES A LOS SUCESOS.


Existen tres maneras diferentes de asignar probabilidades a los sucesos: usando probabilidades subjetivas,
frecuencias relativas, y probabilidades clásicas.

a) Enfoque subjetivo. Este enfoque es adecuado cuando solo hay una oportunidad de ocurrencia del evento y
ocurrirá ó no ocurrirá esa sola vez. Es el grado de creencia por parte de un individuo de que un evento ocurra
basado en toda la evidencia a su disposición. También se le llama probabilidad personalista. Ej. si un equipo de
administración piensa que hay una probabilidad de 0.35 de que un nuevo producto tenga éxito en el mercado.

b) Enfoque de frecuencia relativa ó a posteriori. La probabilidad se determina sobre la base de la


proporción de veces en que ocurren un resultado favorable en un número de observaciones ó experimentos (se
basa en datos históricos). Por ejemplo si una empresa de asesoría presenta 100 propuestas y se aceptan 20, la
probabilidad de que una propuesta futura tenga éxito se puede estimar en 20/100 es decir en 0.20. (Es este un
enfoque objetivo).

c) Enfoque clásico ó a priori. Este enfoque permite la determinación de los valores de la probabilidad antes
de observar cualquier evento y se basa en la suposición de que cada resultado es igualmente posible.

Sea :
E un evento determinado
n número de casos posibles
h numero de caso favorables a la ocurrencia del evento
Entonces:
La probabilidad de ocurrencia del evento E está dado por:
p= h = p (E)
n
_
Sea: E el evento complementario de E
La probabilidad de no ocurrencia del evento E está dado por:
_
q= n-h = p (E)
n
_
Por tanto: p+q=1 p (A) + p (A) = 1

EVENTO CIERTO = p= h = 1
n

EVENTO IMPOSIBLE = p= h = 0
n

Por tanto: 0  p  1
[Link] MUESTREAL:
También se le llama: espacio de eventos. Es el conjunto de todos los eventos posibles. Ejemplos: -
Lanzamiento de un dado S= { 1, 2, 3, 4, 5, 6 } n = 6
Cartas de una baraja estándar n = 52, hay cuatro palos ( espadas, corazones, treboles y diamantes), cada uno
de los cuales tiene 13 cartas diferentes (as, rey, reina, sota, 10, 9, 8, 7, 6, 5, 4, 3, 2, ).

[Link] Ó SUCESO:
Subconjunto del espacio muestral, que puede ser desde un punto del espacio muestral hasta el espacio muestral
completo. Por Ej. El evento de las cartas por palo: E = { espada, corazón, trebol y diamante } ; En el
lanzamiento de un dado: que el resultado sea un número par: E = { 2, 4, 6 }.
El complemento del evento E incluye todos los eventos que no son parte del evento E. Está dado por el
simbolo E'.

[Link] SIMPLE (Marginal ).


La probabilidad simple consiste en la probabilidad de ocurrencia de un evento simple, p (E). Ej.
- La probabilidad de seleccionar un as= 4/52 = 1/13.
- La probabilidad de que al lanzar un dado caiga en la cara superior el número 6 = 1/6.

[Link] CONJUNTA.
Se refiere a fenómenos que contienen dos ó más eventos, como por ejemplo la probabilidad de que al escoger
una carta obtengamos un as negro.

[Link] EN VARIOS EVENTOS.

a) Eventos mutuamente excluyentes. Se da cuando ambos eventos no pueden ocurrir al mismo tiempo. (si
ocurre un evento el otro no puede ocurrir, aunque ambos tienen la probabilidad).
Ejemplo: Moneda ( cara ó escudo), Ganar ó perder, hombre ó mujer, día ó noche, encendido ó apagado.
P (A ó B) = P (A) + P (B) = P (A U B)
También se les llama: “eventos incompatibles”.
Ejemplo. Determinar la probabilidad de sacar un as, un rey ó un 10 de una baraja.
P = 4/52 + 4/52 + 4/52 = 12/52 = 3/13

b) Eventos no mutuamente excluyentes. En este caso si pueden ocurrir eventos al mismo tiempo. Ejemplo:
probabilidad de ganar el examen con 90.
Probabilidad de sacar un 10 y de corazones
P (A ó B) = P (A) + P (B) – P (A  B)

c) Eventos independientes. Cuando la ocurrencia de un evento, no tiene efecto sobre la probabilidad de


ocurrencia del otro. Ej. al lanzar una moneda varias veces la probabilidad de que caiga cara la primera vez,
no afecta la probabilidad de que caiga escudo las siguientes veces
P (A y B) = P (A  B) = P (A) * P (B)
En este tipo de eventos se da reemplazo de los eventos ya escogidos anteriormente.
Por ejemplo si tenemos en un saco cinco bolas blancas y tres bolas negras, encontrar la
probabilidad de que al efectuar 2 extracciones las dos sean bolas blancas, si ocurre un
reemplazo
P = 5/8 * 5/8 = 25/64

d) Eventos dependientes. En este tipo no se da reemplazo de lo ya escogido. Se da cuando la ocurrencia ó no


de uno de los eventos afecta la probabilidad de ocurrencia del otro. Por Ej. sacar dos cartas sin reemplazo
de una baraja.

P (A y B) = P (A B) = p (A) * P (B  A)
(La raya vertical significa dado que)

Considerar el ejemplo anterior si no ocurre reemplazo.


P = 5/8 * 4/7 = 20/56 = 5/14
4.10. DISTRIBUCION DE PROBABILIDAD NORMAL

4.10.1. INTRODUCCION. La distribución normal es de vital importancia en estadística por tres razones
principales:
a) Numerosos fenómenos continuos parecen seguirla ó pueden aproximarse mediante ésta.
b) Podemos usarla para aproximar diversas distribuciones de probabilidad discreta y evitar así pesados
cálculos.
c) Proporciona la base de la inferencia estadística clásica debido a su relación con el teorema del
límite central.
La distribución normal es una distribución continua que tiene forma de campana y está determinada por
su media y su desviación estándar. (es más probable que una observación esté cerca de la media del
conjunto de los datos que lejos ).

La siguiente figura muestra la forma de una curva normal típica. Observe que la curva es simétrica; la
mitad del área bajo la curva está a la derecha de la media y la mitad a la izquierda, lejos de la media hacia
cualquiera de las colas, la altura de la curva disminuye. Esto corresponde a una probabilidad decreciente
de encontrar un valor mientras más lejos esté de la media. La distribución normal teórica tiende al
infinito en los extremos positivo y negativo de la curva. En la práctica este aspecto se ignora ya que la
probabilidad de que ocurra una observación es muy pequeña cuando aumenta la distancia de la media.

4.10.2. PROPIEDADES.
a) Tiene forma de campana y es simétrica en apariencia.
b) Sus mediciones de tendencia central (media, mediana, moda) son todas idénticas.
c) Su variable aleatoria asociada tiene un alcance infinito. ( -  X  + ) .
d) El área total bajo la curva es igual a 1.0, o 100%. El 50% del área está a la derecha de la media y el
50% a la izquierda.
e) Cada combinación de la media y la desviación estándar específica una distribución normal única.
f) La probabilidad de que una variable aleatoria tenga un valor entre cualquiera dos puntos es igual al
área bajo la curva entre esos puntos. Esta área se puede determinar usando el cálculo ó la tabla
normal estándar.
g) La curva normal tendrá en su punto más alto la medía aritmética y es cuando z = 0.
h) El valor de la curtosis es igual a 3.
i) Cuando z= 0 y = 0.39894

4.10.3. MODELO MATEMATICO.


El modelo matemático para obtener las probabilidades en una distribución normal es:

e −(1 / 2)( x −  x /  x 
1 2
p( X ) =
2  x

Donde:

e = es la constante matemática aproximada por 2.71828


 = constante matemática 3.14159
 = media de la población
 = desviación estándar de la población
X= cualquier valor de la variable aleatoria continua. P23/Samuel Reyes
4.10.4. ESTANDARIZACION DE LA DISTRIBUCION NORMAL.
Una distribución normal estandarizada es una distribución cuya variable aleatoria Z siempre tiene una  =
0 y una desviación estándar  = 1, para ello se utiliza la siguiente fórmula de transformación:

X − x
z=
x

El valor z es una medida del número de desviaciones estándar entre la media ó centro de la curva normal
y el valor de interés.
Ejemplo 1. Una curva normal tiene una media igual a 500 y una desviación estándar igual a 25. Un
analista quiere encontrar las áreas bajo la curva normal, tanto abajo como arriba del valor 535. ¿Cuál es el
valor de z correspondiente a 535?.

x− 535 − 500


z= = = 1.40
 25
Sustituyendo en la ecuación anterior tenemos la función de densidad de probabilidad de una variable
normal estándar Z es:

1 − (1 / 2) z 2
f (Z ) = e
2
Por tanto podemos convertir cualquier conjunto de datos normalmente distribuidos a su forma
estandarizada y después determinar cualquier probabilidad deseada a partir de una tabla de la distribución
normal estandarizada.

Ejemplo 2: Una distribución normal tiene una media de 5 y una desviación estándar de 2.1 ¿Cuál es la
probabilidad de que un valor numérico generado de manera aleatoria a partir de esta distribución esté
entre 5 y 6? En la figura se ve el área deseada, estandarizando tenemos que z= (6-5)/2.1 = 0.48

Como el área deseada se extiende de la media de la curva (5) a un punto de interés x (6) el área deseada se
puede leer directamente en la tabla normal estándar usando el valor calculado de z. La columna de la
izquierda de la tabla normal estándar enumera los valores z con sólo un dígito de cada lado del punto
decimal. Como el valor de z es 0.48 se usa la fila de 0.4, los valores de la cabecera de cada columna dan
el segundo dígito a la derecha del punto decimal. Como este dígito es 8, se usa la columna de .08. El
elemento de la tabla donde se cruzan la fila 0.4 y la columna 0.08 es el valor .1844. Por tanto la
probabilidad de obtener un valor entre 5 y 6 es igual al 18.44 %.

Ejemplo 3. ¿Qué porcentaje de los valores de una curva normal puede esperarse que esté a menos de 1, 2,
ó 3 desviaciones estándar de la media? La tabla normal se lee con z= 1, z=2, y z=3 y las áreas se
determinan siguiendo el proceso, después se duplican para tomar en cuenta los valores a la derecha y a la
izquierda de la media.
Z = 1: (.3413) (2) = .6826
Z= 2 : (.4772) (2) = .9544
Z= 3 : (.4987) (2) = .9974

P24/Samuel Reyes
Ejemplo 4. Encontrar el área bajo la curva normal en cada uno de los siguientes casos: (Utilizar la tabla
de probabilidad normal)
a) Entre z = 0 y z = -0.76 Por simetría
el área pedida = área entre z = 0 y z = 0.76
Al observar la gráfica vemos que ésta área se calcula
Directamente y es igual a: p = 0.2764.

b) Entre z = -0.4 y z= 2.18


El área = (área entre z= -0.4 y z= 0) + (área entre
z=0 y z= 2.18)
Area = 0.1554 + 0.4854 = p =0.6408

c) Entre z= 0.27 y z= 0.95


El área = (área entre z= 0.95 y z= 0) – (área entre
z=0 y z= 0.27)
Area = =.3289 – 0.1064 = p = 0.2225

d) El área a la derecha de z= -1.85


El área = (área entre z= -1.85 y z= 0) + (área a la
derecha de 0)
Area = 0.4678 + 0.5000 = 0.9678

Ejemplo 5. Determinar el valor ó valores de z en cada uno de lo siguientes casos, donde el área dada se
refiere a una curva normal.

a) El área entre 0 y z es 0.3554


En la tabla vemos que la cantidad 0.3554 se localiza
A la derecha de la fila 1.00 y bajo la columna
Encabezada por 0.06. Entonces la z pedida es 1.06.
Por simetría, -1.06 es otro valor de z, así que z=  1-06

b) El área a la izquierda de z vale 0.6664


Puesto que el área es mayor que 0.5, z debe ser positivo
Area entre 0 y z = 0.6664 – 0.5000 = 0.1664, de donde
z = 0.43

c) El área entre –1.3 y z vale 0.0283


Si z fuese positivo el área seria mayor que el área entre
-1.3 y 0 que es 0.4032.
Caso 1. Z es negativo pero está a la derecha de –1.3
Area entre –1.3 y z = (área entre –1.3 y 0) – (área entre
0 y z).
0.0283 = 0.4032 – (área entre 0 y z),
Entonces área entre 0 y z = 0.4032-0.0283 = 0.3749
De donde z = -1.15
Caso 2. Z es negativo y está a la izquierda de –1.3
Area entre z y –1.3 = (área entre z y 0) – (área entre
-1.3 y 0)
0.0283 = (área entre 0 y z) –0.4332
Entonces área entre 0 y z = 0.0283 + 0.4332 = 0.4615
Buscando en tabla z = 1.77
APLICACIÓN DE LA DISTRIBUCION NORMAL

La empresa Grear Tire Company acaba de desarrollar un neumático radial con banda de acero que
venderá a través de una cadena nacional de tiendas de descuento. Como ese neumático es producto
nuevo, la dirección de Grear cree que la garantía de millas recorridas que se ofrece con el neumático será
un factor importante en la aceptación. Antes de formalizar esa política, la dirección desea contar con
información acerca de las millas que duran los neumáticos.

En pruebas reales en carretera, el grupo de ingeniería de Grear ha estimado que el promedio de distancia
recorrida es μ = 36,500 millas y que la desviación estándar es σ = 5,000. Además los datos reunidos
indican que la adopción de la distribución normal es una hipótesis razonable. ¿Qué porcentaje de
neumáticos se puede esperar que duren más de 40,000 millas? En otras palabras.¿Cuál es la probabilidad
de que las millas recorridas rebasen las 40,000?.

Cuando x = 40,000 tenemos que


x− 40,000 − 36,500
z= = = .70
 5000
Al emplear la tabla vemos que el área entre el promedio y z = .7 es .2580.
0.5000-.2580 = .2420 es la probabilidad de que x sea mayor que 40,000. Podemos concluir que un 24.2%
de los neumáticos durarán más de 40,000 millas.

Ahora supongamos que Grear planea una garantía según la cual el usuario recibirá un descuento en sus
neumáticos de repuesto, si lo neumáticos originales no rebasan la distancia en millas especificadas en la
garantía ¿cuáles deben ser las millas recorridas para que no haya más de 10% de los neumáticos que
aprovechen el descuento en la garantía?.

El 40% del área debe estar entre la media y las millas recorridas, según la garantía, que por el momento se
desconocen. Buscamos .4000 en el cuerpo de la tabla y vemos que esa área está aproximadamente a 1.28
desviaciones estándar debajo de la media. Esto es z = 1.29 es el valor de la variable aleatoria normal que
corresponde a la garantía deseada de millas recorridas en la distribución normal para Grear Tire. Para
calcular x, la distancia recorrida que corresponde z = -1.28, hacemos lo siguiente:
x−
z= = −1.28

x −  = −1.28

x =  − 1.28

x = 36,500 – 1.28 (5000) = 30,100

En consecuencia una garantía de 30,100 millas cumplirá con el requisito de que aproximadamente el 10%
de los neumáticos sean elegibles para aprovechar la garantía. Quizá con esta información la empresa
establezca en 30,000 su garantía de milla recorridas.
LABORATORIO SOBRE DISTRIBUCION NORMAL

1. Hallar el área bajo la curva normal en cada uno de los siguientes


casos:
a) entre z = 0 y z = 1.2
b) entre z = -0.68 y z =0
c) entre z = -0.46 y z = 2.21
d) entre z = 0.81 y z = 1.94
e) a la izquierda de z = -0.6
f) a la derecha de z = -1.28
g) a la derecha de z = 2.05 y a la izquierda de z = 1.44

2. Determinar el valor o valores de z en cada uno de los siguientes


casos, donde el área dada se refiere a una curva normal.
a) El área entre 0 y z es 0.3770
b) El área a la izquierda de z es de 0.8621
c) El área entre –1.5 y z es de 0.0217

3. La media de los pesos de 500 estudiantes de un cierto colegio es 151


lbs. Y la desviación típica 15 libras suponiendo que los pesos se
distribuyen normalmente, hallar cuantos estudiantes pesan:
a) entre 120 y 155 libras.
b) Más de 185 libras
c) Menos de 128 libras.
d) 128 libras exactas
e) 128 libras ó menos.

4. Las puntuaciones de un ejercicio de auditoria fueron 0, 1, 2,......, 10


dependiendo del número de respuestas correctas a 10 preguntas
formuladas. La puntuación media fue de 6.7 y la desviación típica
1.2 Suponiendo que las puntuaciones se distribuyen normalmente,
determinar:
a) el porcentaje de alumnos que consiguió 6 puntos.
b) La puntuación máxima del 10% más bajo de la clase.
c) La puntuación mínima del 10% superior de la clase.
5. La media de los diámetros interiores de una muestra de 200
arandelas producidas por una máquina es de 0.502 pulgadas y la
desviación típica 0.005 pulgadas. El propósito para el que se
destinan estas arandelas permite una tolerancia máxima en el
diámetro de 0.496 a 0.508 pulgadas, de otro modo las arandelas se
consideran defectuosas. Determinar el porcentaje de arandelas
defectuosas producido por la máquina suponiendo que los diámetros
se distribuyen normalmente.

6. En una examen de Estadística la media fue 78 y la desviación típica


10
a) Determinar las referencias tipificadas de dos estudiantes cuyas
puntuaciones fueron 93 y 62 respectivamente.
b) Determinar las puntuaciones de dos estudiantes cuyas
referencias tipificadas fueron –0.6 y 1.2 respectivamente.

7. Si las alturas de 300 estudiantes se distribuyen normalmente con


media de 68 pulgadas y desviación típica de 3.0 pulgadas, cuantos
estudiantes tienen alturas: a) mayor de 72 pulgadas, b) menor o igual
a 64 pulgadas, c) entre 65 y 71 pulgadas inclusive, d) igual a 68
pulgadas. Supóngase las medidas registradas con aproximación de
pulgadas.

8. El valor medio de una serie de facturas fue de Q. 72.00 y la


desviación típica de Q. 9.00. El 10% superior de las facturas son
calificadas como ingresos tipo A. Cuál es el valor mínimo que una
factura debe de tener para ser calificada como A.

9. Si los diámetros de cojinetes de bolas se distribuyen normalmente


con media 0.6140 y desviación típica 0.0025 pulgadas. Determinar el
porcentaje de cojinetes de bolas con diámetros a) entre 0.610 y 0.618
pulgadas inclusive. B) mayor de 0.617 pulgadas c) menor de 0.608
pulgadas d) igual a 0.615 pulgadas.

[Link] el área bajo la curva normal entre a) z = -1.2 y z = 2.40, b) z =


1.23 y z = 1.87 c) z = -2.35 y z = -0.50
4.8. DISTRIBUCIONES DE PROBABILIDAD

4.8.1. DISTRIBUCIONES DISCRETAS DE PROBABILIDAD

Si una variable X puede asumir un conjunto discreto de valores:

X 1 , X 2 , X 3 ,.............. X n

Con probabilidades:

P1 , P2 , P3 ,.................Pn

Se dice que para la variable X ha sido definida una DISTRIBUCION DE PROBABILIDAD


DISCRETA.
Surge entonces la función p(X) que asume valores

P1 , P2 , P3 ,.................Pn
Respectivamente, en correspondencia con los valores
X 1 , X 2 , X 3 ,.............. X n

A la función p (X) se le llama: “función de probabilidad de x ó distribución de probabilidad de


x”-

Ejemplo:
Hallar la probabilidad que en las familias con tres hijos, existan hombres y mujeres entre ellos,
suponiendo igual probabilidad de nacimientos para cada sexo:
Definimos: M = evento “hijo hombre”
F = evento “hija mujer”
P (M) = P (F) = ½
Posibilidades:
a) Que tenga 3 hijos hombres: P (MMM) = P (M)* P (M) * P(M) = 1/2*1/2*1/2 = 1/8
( eventos independientes)
b) Que tenga 3 hijas mujeres : P (FFF) = P (F) * P (F) * P (F) = 1/2*1/2*1/2 = 1/8
( eventos independientes)
c) Que tenga 2 hombres y 1 mujer: P (MMF + MFM + FMM)
= P (MMF) + P (MFM) + P (FMM)
= 1/2*1/2*1/2 + 1/2*1/2*1/2 + 1/2*1/2*1/2 = 1/8 + 1/8 + 1/8 = 3/8
(La estructura de cada grupo depende del lugar que ocupa la hija mujer en la familia; en esta fase los
eventos son mutuamente excluyentes; en cada grupo específico, los eventos son independientes).
d) Que tenga 2 hijas mujeres y un hombre: P (FFM + FMF + MFF) =
= P (FFM) + P(FMF) + P (MFF)
= 1/2*1/2 * 1/2 + 1/2 *1/2* 1/2 + 1/2*1/2*1/2 = 1/8

Sea X la variable casual que representa el número de hijos hombres en familias con 3 hijos, la
correspondiente distribución de probabilidad p (X), es la siguiente:

P (X) = 1/8 , 3/8 , 3/8 , 1/8


Para x = 0, 1 , 2 , 3 = No. Hijos hombres
En esta forma tenemos definidas las dos variables y se observa que p (X) es función de X. La
representación gráfica de tal función se presenta en la siguiente forma:

PROBABILIDAD DE H IJOS

0.4

PROB.
0.3
0.2
0.1
0
0 1 2 3 4
HIJOS

Porque X asume esos valores discretos, con determinada probabilidad, se le llama Variable Casual discreta
ó Variable Estocástica Discreta.

Si acumulamos los valores de probabilidad obtenida para cada valor de X, tendremos una distribución
acumulada de probabilidad, cuya función asociada se llama Función de Distribución; la cuál se representa con
F (X).

Ejemplo: En el mismo caso visto anteriormente, es decir, X es la variable casual del número de hijos
hombres en familias con 3 hijos; tendremos:

X= 0 , 1 , 2 , 3
P (x) = 1/8 , 3/8 , 3/8 , 1/8
F (x) = 1/8 , 4/8 , 7/8 , 8/8

4.8.2. DISTRIBUCIONES CONTINUAS DE PROBABILIDAD.

Si una variable X puede asumir un conjunto continuo de valores (a, b), siguiendo una determinada ley de
probabilidad Y = p (x), entonces llamamos a X con el nombre de variable Casual continua o variable
Estocástica continua y a p(X) la llamamos como una distribución continua de probabilidad de X, o más
corrientemente una función de Densidad de la Probabilidad.

Ejemplo gráfico: Hallar la probabilidad de que X caiga entre los valores a y b = p (a< x <b)

La solución está representada por la parte sombreada en la gráfica siguiente. (suponemos conocida la ley de
probabilidad ó función de densidad Y = p (x)

a b
b
Ejemplo: la función de densidad (distribución ó función de probabilidad continua) asociada a una variable
casual continua X, está dada por:

P (X) = ½ - 1/8 x

Hallar la probabilidad que el valor de x se localice entre los puntos 1 y 2; es decir hallar p (1< x <2).

En este caso la función ó distribución de probabilidad tiene una forma lineal; es decir, Y = p (x) es de tipo
lineal. Graficando obtenemos una línea recta a través de los puntos siguientes:

P (0) = ½ y p (4) = 0

La probabilidad buscada está entre los extremos: p(1) = 3/8 y p (2) = ¼

En la gráfica siguiente observamos que la probabilidad deseada está representada por la parte sombreada;
entonces, para conocer que valor tiene esa área, recurrimos a la geometría plana que permite hallar la
superficie de la figura allí observada, la cuál es un trapecio.

El área del trapecio es:

A=
 bases * altura
2
Aplicando las cantidades que se tienen resulta:

(3 / 8 + 1 / 4)
A= *1 = 5 / 16
2

La probabilidad buscada es entonces: 5/16

p(x)=1/2-1/8x

0.6
0.5
0.4
p(x)

0.3 p(x)
0.2
0.1
0
0 1 2 3 4 5
x
.
EJERCICIO POISSON

1. Si la probabilidad de que un individuo sufra una reacción por una inyección de un


determinado suero es .001, determinar la probabilidad de que de un total de 2000
individuos: a) exactamente tres tengan reacción. B) más de 2 individuos tengan reacción.

a) exactamente tres

e−2 (2)3 8
P(3) = = = .18
3! (2.71828)2 (6)

b) más de dos = 1 – (P(0) + P (1) + P (2)) = .323

e−2 (2.0)0 1
P(0) = = = 0.1353
0! (2.71828)2 (1)

e−2 (2)1 2
P(1) = = = 0.2706
1! (2.71828)2 (1)

e−2 (2)2 4
P(2) = = = 0.2706
2! (2.71828)2 (2)

probabilidad = 1-0.1353-.2706-.2706 = 0.323

2. Un análisis de datos históricos muestra que la cantidad promedio de automóviles que


llega en un período de 15 minutos a una ventanilla de un autobanco es de 10, la función de
probabilidad sería:

e −10 (10) x
P( x) =
x!

Si la gerencia deseara conocer la probabilidad de que hayan exactamente cinco llegadas en


quince minutos, igualaríamos x = 5 para obtener así, la probabilidad exacta de 5 llegadas en
15 minutos.

5
e −10 (10)5 10 10 = .0378
P(3) = =
5! (2.71828) (5!)
Supongamos que deseamos calcular la probabilidad de una llegada en un período de tres
minutos. Como 10 es la cantidad esperada en un intervalo de 15 minutos, vemos que 10/15
= 2/3 es la cantidad esperada de llegadas en un período de un minuto y que (2/3) (3
minutos) = 2 es la cantidad de llegadas en un período de tres minutos. Entonces la
probabilidad de x llegadas en un periodo de tres minutos con media = 2, se expresa con la
siguiente función de probabilidad de Poisson.

e −2 (2) x
P( x) =
x!

Para determinar la probabilidad de que haya una llegada en un período de tres minutos,
podemos calcularlo así:

e −2 (2)1
P( x) = = 0.2707
1!

3. Ejemplo donde intervienen intervalos de longitud o distancia. Supongamos que nos


interesa la ocurrencia de defectos grandes en un tramo de carretera, un mes después de
recubrirla. Supondremos que la probabilidad de un defecto en este tramo de carretera es
igual para dos intervalos cualesquiera, de igual longitud, y que la ocurrencia o no
ocurrencia de un defecto en cualquier intervalo no depende de la ocurrencia o no ocurrencia
de uno en cualquier otro intervalo. En consecuencia se puede aplicar la distribución de
probabilidad de Poisson.

Supongamos que se ve que los defectos grandes, un mes después de recubrir la carretera, se
presenta con una frecuencia promedio de dos por milla. Vamos a determinar la
probabilidad de que no haya defectos grandes en determinado tramo de tres millas de la
carretera. Como nos interesa un intervalo de tres millas de longitud, media = (2
defectos/milla) (3 millas) = 6, representa la cantidad esperada de defectos grandes en el
tramo de tres millas de carretera, la probabilidad de que no exista ningún defecto grande en
el tramo de tres millas es:

e −6 (6)0
P( x) = = 0.0025
0!

Es decir que es muy improbable que no haya defectos grandes en el tramo de tres millas.
De hecho, hay una probabilidad de 1 – 0.0025 de que al menos haya un defecto grande en
ese tramo.
4. Al departamento de Reservaciones de Aereolineas Regionales llegan en promedio
48 llamadas por hora:

a. Calcule la probabilidad de recibir tres llamadas en un intervalo de cinco minutos.

Media = 48 (5/60) = 4

e −4 (4)3
P( x) = = 0.1952
3!

b. Calcule la probabilidad de recibir exactamente 10 llamadas en 15 minutos.

Media = 48 (15/60) = 12

e−12 (12)10
P( x) = = 0.1048
10!

c. Suponga que actualmente no hay llamadas esperando. Si el agente tarda cinco


minutos en atender una llamada. ¿ Cuantas llamadas cree que estarán esperando
cuando cuelgue la bocina? ¿Cuál es la probabilidad de que ninguna esté esperando?

Media = 48 (5/60) = 4 (se puede esperar


Que haya 4
llamadas esperando
después de 5 minutos)

e −4 (4)0
P( x) = = 0.0183
0!

d. Si actualmente no hay llamadas pendientes. ¿Cuál es la probabilidad de que el


agente pueda ausentarse tres minutos sin interferir con la atención a las llamadas?

Media = 48 ( 3/60) = 2.4

e−2.4 (2.4)0
P( x) = = 0.0907
0!
3. MEDIDAS DE DISPERSION

3.1. INTRODUCCION. El conocimiento de la forma de distribución y de las medidas de


posición puede servir para tener una idea bastante clara de su conformación, pero no
de la homogeneidad de cada uno de los valores con respecto a la medida de
tendencia central aplicada. Las medidas de dispersión permiten apreciar el grado de
variabilidad ó propagación de los datos.

3.2. MEDIDAS DE DISPERSION DATOS NO AGRUPADOS.

3.2.1. RANGO. Es la diferencia entre la mayor y la menor observación en una serie de


datos. Estos es:
Rango = x mayor
− xmenor

Mide la propagación total en la serie de datos, es una medición simple y de fácil cálculo
pero su debilidad es que no logra tomar en cuenta la forma en que los datos se
distribuyen realmente entre el mayor y el menor valor.

Usando los datos del ejemplo 1. (página 5): 2, 4, 5, 6, 7, 9, 10, 12 El Rango sería:

R= 12- 2 = 10

3.2.2. DESVIACION MEDIA. Dado un conjunto de datos tales como X1, X2,....XN, la
desviación media se define como el promedio aritmético de las respectivas desviaciones
absolutas con respecto a la media.
n −
 / Xi − x /
DM = i =1

n
DM= /2-6.875/ + /4-6.875/ + /5-6.875/ + /6-6.875/ + /7-6.875/ + /9-6.875/ + /10-6.875/ + /12-6.875/
8

DM = 2.625

La desviación media es de poca utilidad en inferencia estadística, y no es posible


encontrar la desviación media de un grupo combinado.

3.2.3. LA VARIANZA. Es el cuadrado medio de las desviaciones de una serie de datos,


con respecto a su media aritmética y se calcula de la siguiente manera:

( xi )
2

 (x − x)
− 2
x 2
i −
n
= =
2 i
s
n n

- 11 -
Con los datos del ejemplo 1 tenemos:

Sumatoria Xi= 55
Sumatoria Xi^2 = 455
55 2
455 −
s2 = 8 = 9.6093
8
3.2.4. LA DESVIACION STANDARD. El cálculo de la varianza, se hace utilizando datos
cuadráticos con el objetivo de que las desviaciones no se cancelen entre sí, por esta
razón, es necesario trabajar con valores originales (no elevados al cuadrado) y esto se
logra con la desviación standard. El cálculo de la desviación standard a partir de la
varianza, es simplemente obtener la raíz cuadrada de esta última.

s 2 = 9.6093 = 3.10

Propiedades:
a) El 68.27% de los datos de una distribución, están a una desviación standard de la
media.
b) El 95.45% de los datos de una distribución, están a dos desviaciones estándar de la
media.
c) El 99.73% de los datos de una distribución, están a tres desviaciones standard de la
media.

3.2.5. EL COEFICIENTE DE VARIACION. Es una medida de dispersión relativa que se


obtiene dividiendo la desviación estandar de la serie de datos entre su media aritmética y
se multiplica por 100 para expresarlo en porcentaje. Es un dato adimensional puesto que
los datos con se calcula están expresadas en sus dimensionales originales. Es útil cuando
se quiere comparar series de datos con dos variables diferentes, ejemplo: altura y peso.
s
C.V . = −
* 100
x
3.10
C.V . = * 100 = 45.09
6.875

3.3. MEDIDAS DE DISPERSION DATOS AGRUPADOS.

limites discretos limites reales f xi F fxi x-x f(x-x) ^2 f^2


21 29 20.5 29.5 4 25 4 100 -30.15 -120.6 909.0225 3636.09
30 38 29.5 38.5 12 34 16 408 -21.15 -253.8 447.3225 5367.87
39 47 38.5 47.5 16 43 32 688 -12.15 -194.4 147.6225 2361.96
48 56 47.5 56.5 23 52 55 1196 -3.15 -72.45 9.9225 228.2175
57 65 56.5 65.5 18 61 73 1098 5.85 105.3 34.2225 616.005
66 74 65.5 74.5 15 70 88 1050 14.85 222.75 220.5225 3307.8375
75 83 74.5 83.5 9 79 97 711 23.85 214.65 568.8225 5119.4025
84 92 83.5 92.5 3 88 100 264 32.85 98.55 1079.1225 3237.3675
0
AMPLITUD 9 TOTAL100 465 5515 10.8 1183.95 3416.58 23874.75
- 12 -
3.3.1. RANGO. El rango es la diferencia entre el límite real superior de la clase más alta
y el inferior de la clase más baja. (limite discreto superior clase mal alta - limite
discreto inferior de la clase más baja + uno)
Datos Tabla 2. R= 88-21+ 1 = 68

3.3.2. DESVIACION MEDIA. Para su cálculo se utiliza la siguiente fórmula:


D.M . =
F / x− x/
n
Siguiendo el ejemplo de la tabla 2 tenemos:

DM= 1183.95
100

DM= 11.8395

3.3.3. VARIANZA. Para datos agrupados utilizamos la siguiente fórmula:

− 2

s2 =
 f ( x − x)
n
23874.75
s2 = = 238.7475
100

3.3.4. DESVIACION [Link] la raíz cuadrada de la varianza:

s = 238.7475 = 15.45146

3.3.5. COEFICIENTE DE VARIAC ION: Su cálculo es similar que en el caso de datos no


agrupados.

15.45146
C.V . = *100 = 28.01715
55.15

- 13 -
3. ANALISIS DE REGRESION Y CORRELACION

3.1. INTRODUCCION. En la realidad cotidiana encontramos muchos fenómenos donde se observa que
existe una relación entre dos ó más variables por ejemplo: a) número de clientes y ventas semanales.
b) cantidades de ventas hechas por varios vendedores y los años de experiencia de cada vendedor.
Con el fín de expresar esta relación en forma matemática (ecuación que relacione las variables)
hacemos uso del análisis de regresión “el cuál básicamente se utilizará para hacer predicciones”, el
objetivo es predecir los valores de una variable repuesta ó dependiente (a menudo se identifica
con la letra “y” ) basados en los valores de una variables independiente ó explicatoría (que por
lo general se identifica con la letra “x”), y para medir la intensidad de la asociación de las
variables se usará el análisis de correlación”.

3.2. DIAGRAMA DE DISPERSION. (Diagrama de esparcimiento ó nube de datos) El primer paso del
análisis de regresión es coleccionar los datos indicando el valor de las variables (tabla 1.) y se
representa en un sistema de coordenadas cartesianas, al conjunto de estos puntos se le llama:
diagrama de dispersión (ver gráfica).

Tabla 1. Número de clientes y Ventas semanales (muestra 20 almacenes)

Almacenes Clientes Ventas


1 907 11.20
2 926 11.05
3 506 6.84
4 741 9.21
5 789 9.42
6 889 10.08
7 874 9.45
8 510 6.73
9 529 7.24
10 420 6.12
11 679 7.63
12 872 9.43
13 924 9.46
14 607 7.64
15 452 6.92
16 729 8.95
17 794 9.33
18 844 10.23
19 1010 11.77
20 621 7.41

Diagrama de dispersión de las


ventas semanales y número de
clientes

15
Ventas semanales

10

0
0 500 1000 1500
Número de clientes

- 24 -
En este diagrama observamos una línea que representa aproximadamente los datos, a la cuál se le
denomina: “línea interpolante”.

3.3. TIPOS MODELOS DE REGRESION. La naturaleza de la relación puede tomar formas desde las
más sencillas hasta la funciones matemáticas complicadas. La más sencilla es la relación lineal como la
del ejemplo y que se representa por: Y = a + bx + error
El modelo matemático apropiado que se debe seleccionar está influenciado por la distribución de los
valores de x y y en el diagrama de dispersión, como ejemplo tenemos los siguientes de la gráfica de abajo.
En el panel A sería como el ejemplo, en el B que sería una relación lineal negativa, un ejemplo podría ser
el precio de un producto y las ventas. En el panel C no observamos ninguna relación entre variables. El
panel D muestra una relación curvilínea positiva entre X y Y. Los valores de y aumentan al aumentar x
pero luego este incremento disminuye cuando se sobrepasan ciertos valores de x, un ejemplo podría ser
la edad y el costo de mantenimiento de una máquina, el panel E muestra una relación parabólica ó en
forma de U, entre X y Y. Conforme aumenta X al principio Y disminuye pero a medida que X sigue
incrementándose y no solamente deja de disminuir sino que en realidad aumenta por encima de su valor
mínimo. Un ejemplo podría ser el número de errores por hora cometidos en una cierta tarea y el número
de horas trabajadas en ella. En el panel F se presenta una relación exponencial ó curvilínea negativa, Y
disminuye rápidamente en la medida que X aumenta, pero luego la disminución se hace más lenta
conforme X sigue aumentando. Un ejemplo sería el valor de reventa de un tipo particular de automóvil
con respecto a su antigüedad.

90 90
80 80
70 70
60 60
50 50
Ser i e1 Ser i e1
40 40
30 30
20 20

10 10
0 0
0 2 4 6 8 10 0 2 4 6 8 10

A F
90
80
80
70
70
60
60
50
50
Ser i e1 40 Ser i e1
40
30 30

20 20
10 10
0 0
0 2 4 6 8 10 0 2 4 6 8 10

B C
90
6000 80
70
5000
60
4000 50
Ser i e1
40
3000
30
2000 20
10
1 000
0
0 0 5 10 15 20 25
0 20 40 60 80

D E

- 25 -
3.4. USO DE ECUASIONES NORMALES.
3.5. ERROR ESTÁNDAR DE LA ESTIMACION.
3.6. METODO DE MINIMOS CUADRADOS. El Tipo mas simple de curva de regresión es el de la
línea recta, aunque como ya vimos pueden existir otros tipos, lo que al final buscamos es encontrar
“la línea que mejor se ajusta a los datos” matemáticamente esto significa hallar la línea que
minimice la suma de los cuadrados de las distancias entre la línea del modelo y los puntos de la base
de datos original (medidas en dirección vertical y); para esto se requiere del cálculo diferencial (ver
apéndice B en Estadística para negocios de Hanke). Con las siguientes fórmulas encontraremos la
pendiente (b) y la ordenada al origen de la recta de regresión muestral.

n xy − ( x)( y)
b=
n  x 2 − ( x ) 2

a=
 y − b x
n n
Donde:  x = suma de valores de x.
 y = suma de valores y
 x^2 = suma de los cuadrados de los valores de x
(x)^2= cuadrado de la suma de los valores de x
xy = suma de productos de x e y para cada observación pareada
n = número de observaciones x-y
Para estos cálculos desarrollamos la siguiente hoja electrónica.

x y xy x^2 y^2
1 907 11.2 10158.4 822649 125.44
2 926 11.05 10232.3 857476 122.1025
3 506 6.84 3461.04 256036 46.7856
4 741 9.21 6824.61 549081 84.8241
5 789 9.42 7432.38 622521 88.7364
6 889 10.08 8961.12 790321 101.6064
7 874 9.45 8259.3 763876 89.3025
8 510 6.73 3432.3 260100 45.2929
9 529 7.24 3829.96 279841 52.4176
10 420 6.12 2570.4 176400 37.4544
11 679 7.63 5180.77 461041 58.2169
12 872 9.43 8222.96 760384 88.9249
13 924 9.46 8741.04 853776 89.4916
14 607 7.64 4637.48 368449 58.3696
15 452 6.92 3127.84 204304 47.8864
16 729 8.95 6524.55 531441 80.1025
17 794 9.33 7408.02 630436 87.0489
18 844 10.23 8634.12 712336 104.6529
19 1010 11.77 11887.7 1020100 138.5329
20 621 7.41 4601.61 385641 54.9081
14623 176.11 134127.9 11306209 1602.0971

Con estos resultados realizamos los cálculos:

20(134127.9) − (14623)(176.1)
b=
20(11306209) − (14623) 2
b = 0.00873
- 26 –
176.11 0.00873(14623)
a= − = 2.423
20 20

La ecuación para la mejor línea recta que se ajusta a estos datos es:

Y = 2.423 + .00873 x

Este modelo de regresión que ha sido ajustado a los datos puede utilizarse ahora para predecir las ventas
semanales. Por ejemplo, digamos que nos gustaría utilizar el modelo para predecir las ventas semanales
de una tienda con 600 clientes. Podemos determinar el valor predicho si hacemos X = 600 en nuestra
ecuación:

Y = 2.423 + 0.00873 ( 600 ) = 7.661

Cuando se hacen predicciones fuera del rango de los valores originales se presupone que la relación
ajustada es válida para todos los valores, en donde debe de tenerse cuidado pues el alcance relevante que
teníamos ahora se ha convertido en una extrapolación. Cuando el calculo se realiza dentro del rango
estamos hablando de una interpolación.

3.7. COEFICIENTE DE CORRELACION. El coeficiente de correlación es un valor entre –1 y +1 que


indica la fuerza de la relación lineal. Para una población se identifica como  (la letra griega rho) y para
una muestra se identifica como r.
El valor de –1 indica una relación lineal negativa perfecta, +1 una relación lineal positiva perfecta y 0
indica que no hay relación lineal. La siguiente ecuación se usa para calcular este coeficiente:

n xy − ( x)( y )
r=
n x − ( x ) 2 n y 2 − ( y ) 2
2

En el ejemplo que venimos desarrollando:

20(134127.9) − (14623)(176.11)
r= = 0.9555
20(11306209) − 146232 20(1602.0971) − (176.11) 2

Esto indica un grado de correlación bastante aceptable.

3.7. MEDICIONES DE VARIACION EN REGRESION Y CORRELACION.


Con el fin de examinar que tan bien una variable independiente predice a la variable dependiente en
nuestro modelo estadístico, necesitamos desarrollar algunas medidas de variación. La primera de ellas es
la SUMA TOTAL DE CUADRADOS (SST), que es una medida de la variación de los valores Yi
alrededor de su media, Y. Esta se divide en: VARIACION EXPLICADA ó SUMA DSE CUADRADOS
DEBIDA A LA REGRESION (SSR) que se puede atribuir a la relación entre X y Y; y la VARIACION
NO EXPLICADA Ó SUMA DE CUADRADOS DEL ERROR (SSE), que se puede atribuir a factores
diferentes a la relación entre X y Y.

− −2
SST =  (Y − Y ) =  Y − n Y
2 2

SSE = (Y − Y ) 2 = Y 2 − aY − b XY


SSR =  ( y − y)2 = SST − SSE

- 27 –

SSR = a y + b xy − n y 2

En el ejemplo:

SSE = 1602.0971-(2.423)(176.11)-(0.00873)(134127.90)=4.446

SST = 1602.0971-20(8.8055)^2 = 51.3605

SSR = (2.423)(176.11)+(0.00873)(134127.90)-20(8.8055)^2=46.9145

SST = SSR + SSE

51.3605 = 46.9145 + 4.446

COEFICIENTE DE DETERMINACIÓN r^2 puede definirse como:

suma cuadrados debido regresiòn SSR 46.9145


r2 = = = = 0.913
suma total cuadrados SST 51.3605

El coeficiente de correlación puede calcularse también a través de calcular la raíz cuadrada del
coeficiente de determinación. (comprobar esto con el resultado obtenido por la fórmula.

EL ERROR ESTANDAR DE LA ESTIMACIÓN

La ecuación de regresión no es un pronosticador perfecto, en realidad es un pronosticador aproximado.


La medida de la variabilidad alrededor de la línea de regresión (su variación estándar) se conoce como
error estándar de la estimación. La forma de calcular este error estándar es:

S yx =
 ( y − yp) 2

n−2

El cálculo puede simplificarse debido a la siguiente identidad:

 ( y −yp) 2
=  y 2 − a y − b xy

Quedando de la siguiente forma:

S yx =
y 2
− a y − b xy
n−2

En el ejemplo:

1602.0971 − (2.423)(176.11) − (0.00873)(134127.90)


S yx = = 0.497
20 − 2

Con esta información podríamos construir intervalos de confianza para la ecuación sumándole el valor
(Syx) (z) a la ecuación encontrada. El z variará dependiendo del nivel de confianza que deseemos.
LA DISTRIBUCION BINOMIAL

Es una distribución de probabilidad discreta que implica la posibilidad de obtener x éxitos en n pruebas
de un experimento binomial.

La distribución binomial posee cuatro propiedades esenciales.


a) Las observaciones posibles pueden obtenerse mediante dos métodos de muestreo distintos. Cada
observación puede considerarse como seleccionada de una población infinita sin reemplazo ó de una
finita con reemplazo.
b) Cada observación puede clasificarse en una de dos categorías mutuamente excluyentes y
colectivamente exhaustivas (si uno de los eventos debe de ocurrir), usualmente denominados: éxito ó
fracaso.
c) La probabilidad de que una observación se clasifique como éxito, p, es constante de observación a
observación ( es estacionario ).
d) El resultado de cualquier observación es independiente de cualquier observación.

Un buen ejemplo de un experimento binomial es el de lanzar una moneda al aire varias veces. Sólo hay
dos resultados posibles en cada prueba ó tirada de la moneda (cara ó escudo), la probabilidad de obtener
cara ó escudo sigue constante de una tirada a otra (0.5 para cada una) y las tiradas son independientes
entre sí.

Ejemplo. Cuál es la probabilidad de que se obtengan dos caras al lanza una moneda tres veces. Un
método para calcular la probabilidad en una situación así es usar un diagrama de árbol.

Cada rama representa una tirada. La regla de la multiplicación se usa para calcular la probabilidad de
cada manera independiente en la que pueden salir dos caras. Observe que cada manera de obtener dos
caras tienen la misma probabilidad. La regla de la suma se usa después para calcular la probabilidad final
de obtener dos caras: esta probabilidad es .375.

El segundo método es mediante el modelo de distribución binomial el cuál requiere de tres valores:
a) El número designado de éxitos ( X )
b) El número de ensayos ú observaciones ( N )
c) La probabilidad de éxitos en cada ensayo ( p ). El fracaso = q = P - 1

La fórmula a usar es:


n n!
p( X ) = n C x p x ( q) n − x = ( ) p x ( q) n − x = p xqn− x
x x!(n − x)!
Continuando con el ejemplo:

3 3!
p( X )=3 C2 0.52 (0.5)3− 2 x = ( )0.52 (0.5)3− 2 = 0.520.53− 2
2 2!(3 − 2)!
El resultado es 0.375. p 19/SR
Otro método utilizado es el de la tabla binomial La tabla binomial se divide en bloques uno por cada
valor de n, el número de pruebas ( usaremos en este curso una tabla de 30 bloques con sus respectivos
posibles valores de x). Los encabezados de las columnas representan los valores de p que van desde 0.1
hasta 0.5. Al leer las probabilidades en la fila x y la columna p apropiadas (del bloque n correspondiente)
se evita tener que resolver la fórmula binomial. En nuestro ejemplo buscamos el bloque n = 3,
intersectamos la fila de x = 2 con la columna correspondiente a p = 0.5 y obtendremos el mismo 0.375
que hemos obtenido por los otros dos métodos.

4.9.1. PROPIEDADES.

a) La media =  = np. En nuestro ejemplo = 3*0.5 = 1.5.


b) La varianza =  = npq
c) La desviación estandar =  = npq
d) Coeficiente de asimetría = r3 =
q− p 0.5 − 0.5
r3 = =0
npq 3 * 0.5 * 0.5

4.9.2. GRAFICOS ILUSTRATIVOS DE LA DISTRIBUCION BINOMIAL.

Ejemplo: Se tiene un saco con 5 bolas; un blanca y cuatro [Link] se extrae una bola es reemplazada
por otra igual. Cuál es la probabilidad que en 3 extracciones sucesivas: a) se extraigan 3 bolas blancas, b)
dos bolas blancas, c) una bola blanca, y d) 0 bolas blancas.

Los resultados de este ejemplo se obtienen aplicando la distribución binomial estudiado ( en este caso p=
0.20)

X= 0 , 1 , 2 , 3
SERIE 1 P (x)= 0.512 , 0.384 , 0.096, 0.008

Se supone p (x) continua para trazar la gráfica con fines ilustrativos.

Si suponemos que n = 8 en este ejemplo, las extracciones tienen las siguientes probabilidades:

SERIE 2 X= 0 , 1 , 2 , 3 , 4 , 5 , 6 , 7 , 8
P (x) = 0.1678 , 0.3355, 0.2936, 0.1468, 0.0459, 0.0092, 0.0011, 0.0001, 0.0000

La gráfica sería la siguiente:


P 20/ Samuel Reyes
PROB. BOLAS BLANCAS

0.4
1
0.3 2

P (x)
0.2
0 3
0.1
4
0 5 6 7 8
0 5 10
X

SERIE 3
Comprarando las anteriores dos gráficas con la de n = 20 tendríamos:

VARIACIONES P(X) EN RELACION


A VARIACIONES DE N

0.6
0.4 Serie1
p (X)

0.2 Serie2
0 Serie3
-0.2 0 10 20 30
X

OBSERVACIONES:

1. Las curvas son asimétricas a la derecha si p  q


2. Para n que tiende al infinito la curva es más simétrica y tiende a ser como la curva normal.
3. Si p es constante y n aumenta, la curva tiende a ser como la curva normal.

VARIACIONES DE LA FUNCION P (X) EN RELACION A VARIACIONES DE P

VARIACIONES P (x) EN RELACION


A VARIACIONES DE P

0.6
0.4 Serie1
P (X)

0.2 Serie2
0 Serie3

-0.2 0 5 10 15

OBSERVACIONES:

a) Si los valores de n son constantes, los cambios de p afectan la curva y a medida que se aparta p de 0.5
en más ó en menos, la forma de la curva tiende a ser más asimétrica.
b) Para p = 0.5 la curva es simétrica, cercana a la curva normal.

P 21/ Samuel Reyes


ESPERANZA MATEMATICA

Si p es la probabilidad de que una persona reciba una suma de dinero S, la esperanza matemática
ó simplemente la esperanza se define como pS.

Ejemplo: Si la probabilidad de que un hombre gane un premio de Q. 100.00 es 1/5, su


Esperanza es 1/5*100 = 20.

El concepto de esperanza es fácilmente generalizado. Si X representa una variable aleatoria


discreta que puede tomar los valores X1, X2.........Xk con probabilidades respectivas p1, p2, ......pk donde
p1+ p2......+ pk = 1, la esperanza matemática de X ó simplemente la esperanza de X simbolizada por
E(X), se define como:

E(X) = p1X1 + p2X2+...............+ pkXk


Esto es igual a:

 piXi =  pX
i =1

Si las probabilidades pi en esta esperanza se sustituyen por las frecuencias relativas fki/N, donde
N =fi, la esperanza se reduce a (  fX / N), que es la media aritmética de una muestra de tamaño N, en
la que X1, X2, ......Xk aparecen con estas frecuencias relativas. Cuando N crece, las frecuencias relativas
fi / N se aproximan a las probabilidades pi. Esto conduce a interpretar que E (X ) representa la media de
la población de la que se ha extraído una muestra. Se denota por m la media de la muestra, la media de
la población vendrá representada por la correspondiente letra griega .
DISTRIBUCION NORMAL EN EXCEL.

Samuel Reyes

1. Como encontrar el valor de probabilidad. Cuando necesitamos calcular una


probabilidad normal, en Excel existen dos opciones:

a) Utilizando la fórmula DISTR. NORM. ESTAND del formulario en la


categoría de Estadísticas. Se ingresa el valor de “z” y como resultado aparece la
“probabilidad”. La ventaja es que a diferencia de la mayoría de tablas acepta que
el z sea negativo. El resultado que aparece es una integración desde “menos
infinito” hasta el “z” que ingresamos. El valor de “z” se calcula de la siguiente
forma:

x−x
z=

b) Utilizando la fórmula DISTR. NORM del formulario en la categoría de


Estadísticas. Se ingresan los valores de “x”, “media”, “desviación típica” y luego
tiene la opción en “acumulado” de colocar Verdadero si necesitamos la
integración desde “menos infinito” hasta el valor de “x” que estamos ingresando ó
de colocar Falso si lo que nos interesa es exactamente la probabilidad del valor de
x que estamos ingresando. La ventaja en este caso es que no necesitamos calcular
el valor de “z”.

c) Para ambas fórmulas si deseamos la probabilidad del punto hacia arriba (hacia
el lado derecho) el resultado que obtenemos en a ó b debemos de restarlo de 1 que
es la probabilidad completa.

2. Como encontrar el valor de “x”. En ocasiones conocemos la probabilidad y lo que


necesitamos es calcular un valor de x, Excel tiene dos opciones:

a) Utilizando la fórmula DISTR. NORM. INV. del formulario en la categoría de


Estadísticas. Se ingresan los valores de “probabilidad”, “media” y “desviación típica” ,
como resultado nos da el valor de “x” que estamos buscando. Note que acá no se pasa
por “z”.

b) Utilizando la fórmula DISTR. NORM. INV. ESTAND del formulario en la categoría


de Estadísticas. Se ingresa el valor de la “probabilidad” y como resultado nos da el valor
de “z”. Luego para calcular el valor de “x” use la siguiente fórmula:

x = x  z
c) Si la probabilidad que conocemos es del valor Z ó X para arriba antes de ingresar la
probabilidad debemos de restarla de 1, porque Excel integra desde menos infinito al
punto.
EJERCICIOS EXPONENCIAL

1. Se ha comprobado que el tiempo de vida de cierto tipo de máquina sigue una distribución
exponencial con media de 16 meses. ¿Cuál es la probabilidad de que una empresa que la
usa deba sustituirla antes de 20 meses?

1
f ( x) = e − 20 / 16
16

p( x  xo ) = 1 − e −20 / 16 = .7135

2. En un experimento de laboratorio se usan 10 gramos de un isótopo de fósforo. Sabiendo


que la duración media de un átomo de esta materia es de 140 días ¿Cuántos días
transcurrirán hasta que haya desaparecido el 90% de esta materia?

p( x  xo ) = 1 − e − x / 140 = .90
e − x / 140 = 1 − .90
x
= ln 0.1
− 140

x = -140 (ln 0.1)

x = 322 días

[Link] tiempo entre llegadas de vehículos a determinado crucero sigue una distribución
exponencial de probabilidad, con una media de 12 segundos.

a. ¿Cuál es la probabilidad de que el tiempo entre las llegadas de dos vehículos sea de
12 segundos ó menos?

p( x  12) = 1 − e−12 / 12 = 1 − .3679 = .6321


b. ¿Cuál es la probabilidad de que ese tiempo sea de seis segundos o menos?

p( x  12) = 1 − e−6 / 12 = 1 − .6065 = .3935

c. ¿Cuál es la probabilidad de que haya 30 segundos ó más entre las llegadas de


vehículos?
p( x  30 = 1 − p( x  30)
= 1 − (1 − e − 30 / 12 )
= 0.0821

4. Se tiene la siguiente función de densidad de probabilidad exponencial.

1 −x /3
f ( x) = e para x mayor o igual que 0.
3

a. Deduzca la fórmula p(x ≤ xo ).

p( x  xo ) = 1 − e− x / 3

b. Determine p ( x ≥ 3).

p( x  30 = 1 − p( x  3)
= 1 − (1 − e − 3 / 3 )
= 0.3679

c. Determine p ( 2 ≤ x ≤ 5).

P (x ≤ 5) – p( x ≤ 2)
=.8111 - .4866
= 0.3245
d. Determine p (x ≤ 2).

p( x  2) = 1 − e−2 / 3 = 1 − .5134 = .4866


e. Determine p (x ≤ 5.)

p( x  5) = 1 − e−5 / 3 = 1 − .1889 = .8111

También podría gustarte