Esta Fun
Esta Fun
x + x + ....... + x
r r r x
j =1
r
j
x r
x =
r 1 2
= n
=
n n n
n −
(xj =1
j − x) r
( x − x)
−
r
−
mr = = = ( x − x) r
n n
(2)
Si r=1, m1=0
Si r=2, m2=s^2 (varianza)
(x
j =1
j − A) r
( x − A) r
d r
mr = = = = ( X − A) r
n n n
(3)
Para datos agrupados los factores son multiplicados por “f” en cada
caso.
- 14 -
4.2.1. PRIMER COEFICIENTE DE PEARSON. En distribuciones sesgadas, la
media tiende a situarse con respecto a la moda al mismo lado que la cola
−
55.15 − 52.75
x − Mo sesgo = = 0.15533
sesgo = 15.4515
s
más larga. Así una medida de la asimetría nos dada por la diferencia
(Media-Moda) y se adimensiona dividiéndola por una medida de dispersión.
−
3( x − Me) 3(55.15 − 54.54)
sesgo = sesgo = = 0.1177
s 15.4515
28595.025
m 100
coeficient e sesgo = a3 = 33 = = 0.0775
s 15.45 3
[Link]. COEFICIENTE b1
- 15 -
4.2.3. CURTOSIS. Es el grado de apuntamiento de una distribución,
normalmente se toma en relación a una normal. Una distribución que
presenta un apuntamiento relativo alto, se le llama: leptocúrtica, mientras
que la curva que es más achatada se llama platicúrtica. La distribución
normal se llama: mesocúrtica.
m4
curtosis = a 4 =
s4
13213480.8
a4 = 100 = 2.318
15.45 4
A4 = 2.318 – 3 = -0.6818
- 16 -
2. MEDIDAS DE POSICION
2.1. DATOS NO AGRUPADOS. Se utiliza para analizar poblaciones ó muestras pequeñas,
generalmente cuando tienen 30 ó menos elementos.
2.1.1. MEDIDAS DE TENDENCIA CENTRAL. Son medidas que describen el centro de una
distribución, que es donde se localizan la mayor parte de los datos (caso típico en la
distribución normal).
xi
x= i =1
−
( xi − x) = 0
aritmética es cero. Desviación = (xi-x).
d) si en una serie de datos estos aparecen multiplicados por un valor K, la media nueva será
la
media anterior multiplicada por la constante.
e) Si en una serie de datos estos aparecen sumados por un valor h constante, la media
nueva
será la media anterior más h.
[Link]. MEDIA PONDERADA. Suponga que en una tienda se venden 3 marcas de jugo de
naranja a Q. 4.10, 4.20, y 4.30 y que en un día cualquiera se vendieron latas de los tres
precios. El precio medio de venta por lata sería: 4.20. A primera vista parecería que el
valor es bastante representativo pero si además se sabe que se vendieron 23 latas de
4.20, 72 latas de 4.10 y 5 latas de 4.30 el precio medio de lata vendida en ese día sería:
-6-
Definición: Sea dado un conjunto de datos, tales como x1, x2, x3,.......xn y un conjunto de
valores p1, p2, p3,........pn, asociados con cada observación xi respectivamente, que reciben
el nombre de factores de ponderación. Luego la media ponderada se define como:
− n
xiPi
xp=
i =1 Pi
[Link]. LA MEDIANA. Es el valor que divide en dos partes iguales a una serie de datos finitos.
Para encontrar la mediana es necesario ordenar los datos, y pueden ocurrir dos casos:
a) que el número de datos sea impar: la mediana será el valor central de la serie.
Ejemplo: 3, 5, 8, 12, 25 La mediana es 8.
b) que el número de datos sea par: Entonces la mediana será la media aritmética de los valores
centrales. Ejemplo: 2, 4, 7, 25, 39, 47 La mediana es 16 ó sea la media de 7 y 25.
[Link]. LA MODA. Es el valor que ocurre con más frecuencia en una serie de datos. Ej: 1, 5,
6, 6, 7, 8, 9 La moda es igual a 6. En algunas series como 1, 2, 3, 4, 5, 7, 8 no existe
moda y la distribución se denomina: amodal, hay algunas otras series donde existen
más de una moda y la distribución entonces toma el nombre de Bimodal, Trimodal, etc.
Según sea el caso.
Tabla 3. Hoja de Cálculo para Medidas de Posición. Productividad 100 Trabajadores, Piezas
Aceptables
f = Frecuencia simple.
F = Frecuencia acumulada
Xi = Marca Clase (punto medio de la clase)
fxi = Frecuencia simple
-7-
2.2.1. MEDIDAS DE TENDENCIA CENTRAL.
− fxi n
fxi
x= i =1 −
n
x= i =1
i =1
fi n
− 5515
x= = 55.15
100
(100 / 2 − 32)
Me = 47.5 + 9
23
Mediana = 54.54
-8-
[Link] MODA Para su calculo se utiliza la siguiente fórmula.
(d1)
Mo = Li + c
d1 + d 2
La “clase modal” es la clase que tiene la más alta frecuencia, en el ejemplo que estamos
desarrollando sería 48-56 que tiene una frecuencia de 23, su calculo sería así:
d1= 23-16 = 7
d2= 23-18=5
(7 )
Mo = 47.5 + 9
(7 + 5)
Moda= 52.75
− −
Mo = x − 3( x − Md )
2.2.2. CUANTILES Son medidas de posición que sitúan valores a diferentes puntos de la
distribución, los más utilizados son los quartiles, los deciles y los percentiles.
Q1= 43.5625
-9–
[Link]. DECILES: Dividen la distribución en diez partes iguales:
D1,D2,D3,D4,D,5,D6,D7,D8,D9
Dj; j= 1, 2, 3, 4, 5, 6, 7, 8, y 9
Ejemplo:
(nj / 10 − fa)
Dj = Li + c
f
((100 * 8) / 10) − 73
D8 = 65.5 + 9 = 69.7
15
P85= 72.7
- 10 -
DISTRIBUCION DE POISSON
Se usa para modelar situaciones en las que el número de pruebas es muy grande y el número de
éxitos es muy pequeño.
Un proceso de Poisson existe si podemos observar eventos discretos en un área de oportunidad, un intervalo
continuo (de tiempo, longitud, área, etc.) de tal manera que si acortamos el área de oportunidad ó intervalo de
manera suficiente:
1) La probabilidad de observar exactamente un éxito en el intervalo es estable.
2) La probabilidad de observar exactamente más de un éxito en el intervalo es 0.
3) La ocurrencia de un éxito en cualquier intervalo es estadísticamente independiente de aquella en
cualquier otro intervalo.
Supongamos que examinamos el número de clientes que llegan durante la hora del almuerzo de 12 a 1 PM en
un banco localizado en el distrito comercial central de una ciudad grande. Cualquier llegada de un cliente es
un evento discreto en un punto particular sobre el intervalo continuo de una hora. Durante tal intervalo de
tiempo puede haber un promedio de 180 llegadas. Ahora, si tuviéramos que dividir el intervalo de una hora
en 3600 intervalo consecutivos de un segundo.
1) El número (o promedio) esperado de clientes que llegan en cualquier intervalo de segundos sería 0.05.
2) La probabilidad de que más de un cliente llegue en cualquier intervalo de un segundo es 0.
3) La llegada de un cliente en cualquier intervalo de un segundo no tiene efecto sobre (es decir, es
estadísticamente independiente de la) llegada de cualquier otro cliente en cualquier otro intervalo de un
segundo.
e − x
P( X = x ) =
x!
Donde:
P(X= x ) = Probabilidad de X= x dado que se conoce .
= número esperado de éxitos.
e = constante matemática aproximada por 2.71828
x = número de éxitos por unidad.
Observe que solo se necesita una medida para calcular la probabilidad de un valor dado de x: ( número
esperado de éxitos).
CARACTERISTICAS.
FORMA: Cada vez que se especifica el parámetro puede generarse una distribución de probabilidad de
Poisson específica. Una distribución de Poisson estará sesgada a la derecha cuando es pequeña, y se
aproxima a la simetría (con un pico al centro) al crecer .
Para resolver debemos convertir los segundos en minutos. Llegadas por minuto = (0.05) 60 = 3
Usando la ecuación tenemos:
e−3 (3.0) 9
P(2) = = = 0.2240
2! (2.71828)3 (2)
EJEMPLO 2.
Un problema que enfrenta Central Motor se refiere a la centralita de teléfonos de la oficina principal. El
número de personas que operan la centralita varía mucho durante el día, aun cuando el número de llamadas
que entra permanece constante durante todo el día. Después de verificar la aleatoriedad, el gerente decide que
las llamadas sin duda son aleatorias. No parece haber ciertas horas en el día en que entren más llamadas que
en otras y no parece haber ningún patrón. La gerencia decide que la unidad de tiempo a evaluar será un
intervalo de cinco minutos. Para usar la distribución de Poisson el analista de la central debe calcular la
media, o el número promedio de ocurrencias por intervalo de cinco minutos durante el día de trabajo. Se
seleccionan varios intervalos de cinco minutos al azar durante la siguiente semana. Se encuentra que el
número promedio de llamadas durante ese intervalo es 4.8. Este valor es la media de la distribución de
Poisson que se usa para calcular las probabilidades.
La distribución de Poisson se ha resuelto para cientos de valores se ha compilado en tablas, como las que se
distribuyeron en clase. Los resultados por esta vía sería:
X P(x)
0 0.0082
1 0.0395
2 0.0948
3 0.1517
4 0.1820
5 0.1747
6 0.1398
7 0.0959
8 0.0575
9 0.0307
La representación gráfica sería:
P(x)
0.2
0.18
0.16
0.14
0.12
0.1 P(x)
0.08
0.06
0.04
0.02
0
0 2 4 6 8 10
e − np (np) x
p ( x) =
x!
Y se operaría normalmente con la ecuación para la distribución de Poisson ó haciendo uso de la tabla.
Ejemplo. Calcular la probabilidad de obtener exactamente una llanta defectuosa de una muestra de 20 si 8%
de las llantas fabricadas en una planta particular son defectuosas.
n = 20
P = 0.08
np = 1.6
De la tabla: p (1) con np= 1.6 = () . P (1) = 0.3230
El gerente de una tienda estima que la probabilidad de que cualquier cliente compre es de
0.30. ¿Cuál es la probabilidad de que dos de los siguientes tres clientes hagan una compra?
3 3!
p( X )= 3 C 2 0.32 (0.7) 3−2 = ( )0.32 (0.7) 3−2 = 0.32 0.7 3−2
2 2!(3 − 2)!
Resultado = 0.189
10 10!
p( X )=10 C4 0.34 (0.7)10− 4 = ( )0.34 (0.7)10− 4 = 0.340.7 6
4 4!(10 − 4)!
Resultado = 0.2001.
Supongamos que para el mes próximo se pronostica que 1000 clientes entren a la tienda.
¿cuál es la cantidad esperada de clientes que harán una compra?
Para aumentar la cantidad esperada de ventas debe inducirse a más clientes para que entren
a la tienda.
EJERCICIOS DE PROBABILIDADES
2. Si se extraen sucesivamente dos bolas de una caja que contiene 5 bolas blancas y 3
bolas rojas. Cual es la probabilidad de que las bolas obtenidas sean blancas si:
a) se reemplaza la 1ª. Bola.
b) No se reemplaza.
4. Una empresa elabora repuestos y fabrica diez en total diariamente distribuidos así:
tres repuestos de motor, 5 repuestos eléctricos y dos para frenos. Si se seleccionan
sucesivamente tres repuestos al azar sin reemplazarlos hallar las probabilidades
siguientes:
[Link] sean dos de motor y uno de frenos.
P (A) = 3/10 * 2/9 * 2/8 = 12/720 = 1/60
[Link] sean dos de frenos y uno eléctrico.
P (A) = 2/10 * 1/9 * 5/8 = 10/720 = 1/72
[Link] al menos dos sean de motor.
P (A) = 3/10 * 2/9 * 1/8 = 6/720 = 1/120 tres piezas motor.
P (B) = 3/10 * 2/9 * 7/8 = 42/720 = 7/120 dos piezas de motor ó 1 cualquiera.
P (A) + P (B) = = 1/120 + 7/120 = 8 /120 = 4/60 = 1/15
d. Que tres piezas sean de motor.
P (A) = 3/10 * 2/9 * 1/8 = 6/720 = 1/120.
e. Que sean uno de cada tipo.
P (A) = 3/10 * 5/9 * 2/8 = 30/720 = 3/72 = 1/24
REGLAS DE CONTEO
Primero que nada suponga que una moneda se ha lanzado al aire 10 veces ¿Cómo
determinaríamos el número de diferentes resultados posibles (las secuencias de caras y
escudos)
Si una moneda (con dos lados) se arroja 10 veces, el número de resultados es 2¹º = 1024. Si
un dado (con seis lados) se lanza dos veces, el número de resultados es 6² = 36. La segunda
regla de conteo es una versión más general de la primera. Para ilustrar esta regla, suponga
que el número de eventos posibles es diferente en algunos de los intentos. Por ejemplo, una
ofician estatal de vehículos automotores desearía saber de cuantos números de placas
policíacas se dispondría si la placa consistiera en tres letras seguidas de tres dígitos. El
hecho que tres valores sean letras (cada una con 26 resultados posibles) y tres posiciones
sean dígitos (cada uno con 10 resultados) lleva a la segunda regla de conteo.
Regla de conteo 2: Si hay k , eventos del primer intento, k2 eventos del segundo intento,...
y kn eventos del n ésimo intento, entonces el número de resultados posibles es
(k1)(k2)..... (kn)
Por lo tanto, si una placa policíaca consistiera de tres letras seguidas de tres dígitos,
el número total de resultados posibles sería entonces (26)(26)(26)(10)(10)(10) =
17,576,000. Tomando otro ejemplo, si un menú de restauran tuviera una cena completa de
precio fijo que consistiera en un aperitivo, entrada, bebida, y postre y hubiera la opción de
cinco aperitivos, diez entradas, tres bebidas y seis postres, el número total de cenas posibles
sería (5)(10)(3)(6) = 900.
Regla de conteo 3: el número de formas en que los n objetos pueden ordenarse es:
n!= n (n-1).....(1)
Por lo tanto, el número de arreglos ordenados de cuadro libros seleccionados de seis libros
es igual a:
n! 6! 6! (6)(5)( 4)(3)( 2)(1)
= = = = 360
(n − x)! (6 − 4)! 2! (2)(1)
n!
x!(n − x)!
n
Esta expresión puede denotarse mediante el símbolo. .
x
Comparando esta regla con la anterior, vemos que difiere sólo en la inclusión de un
termino x! en el denominador. Esto se debe a que cuando contamos permutaciones, todos
los arreglos de x objetos eran distinguibles; con las combinaciones, los x! arreglos posibles
de objetos no son importantes. Así, el número de combinaciones de cuatro libros
seleccionados de seis libros se expresa mediante:
Tomado de Berenson.
DESARROLLO DE MINIMOS CUADRADOS PARA ANALISIS DE REGRESION
ŷ =bo+b1x
y
(x,y)
d = y− y
d = y − (bo + b1 x)
d 2 = y − (bo + b1 x
2
d = y − (bo + b1 x)
2 2
= ( y − bo − b1 x) 2
DERIVADAS PARCIALES
= 2 ( y − b1x − bo )( − x) = 2 ( y − b1x − bo )( −1)
b1 bo
= 2 (− xy + b1 x 2 + bo x) = 2 (− y + b1 x + bo )
2 (− xy + b1 x 2 + bo x) = 0 2 (− y + b1 x + bo ) = 0
(− xy + b x + b x = 0
1
2
o
(− y + b x + b = 0
1 o
− xy + b x + b x = 0
o 1
2
− y + Nb + b x = 0
o 1
PARA ENCONTRAR bo y b1 TALES QUE Σd² ES UN MINIMO
bo x + b1 x 2 = xy X N
Nb1 x 2 − b1 ( x) 2 = N xy − x
Nbo + b1 x = y X x b1 ( N x 2 − ( x) 2 = N xy − x y
Nbo x + Nb1 x = N xy
2
Nbo x + b1 ( x) 2 = x y
Nbo + b1 x = y
N xy − x y
b1 = Nbo = y − b1 x
N x 2 − ( x) 2
bo =
y − b x
1
N N
DISTRIBUCION DE PROBABILIDAD EXPONENCIAL
1
FUNCION DE DENSIDAD: f ( x) = e− x /
Supongamos que el tiempo que se tarda en cargar un camión en un muelle sigue esa
distribución. Si la media del tiempo, o tiempo promedio para cargarlo es de 15 minutos .
Su función de densidad de probabilidad es:
1 − x / 15
f ( x) = e
15
0.07
0.06
0.05
probabilidad
0.04
0.03
0.02
0.01
0
0 10 20 30 40 50
tiempo de carga
FUNCION DE DISTRIBUCIÓN:
El área bajo la curva que corresponde a cierto intervalo equivale a la probabilidad de que la
variable aleatoria asuma un valor en ese intervalo. En el ejemplo anterior, la probabilidad
de que la carga de un camión dure 6 minutos ó menos se define como el área bajo la curva
de x=0 a x=6 en la gráfica de arriba. Para calcular esto utilizamos la siguiente fórmula:
p( x xo ) = 1 − e − xo /
p( x xo ) = 1 − e − xo / 15
Por tanto la probabilidad de que la carga de un camión dure seis minutos ó menos es:
p( x xo ) = 1 − e −6 / 15 = .3297
1) Una familia real procrea tres hijos (hombres y mujeres), establecer la probabilidad de
que cuando se necesite nombrar un nuevo rey la decisión se realice entre dos
alternativas.
2) En una carretera asfaltada se encuentran 30 baches por cada 100 kilómetros en
promedio, cuál es la probabilidad de encontrar 2 baches en 10 kilómetros.
3) La temperatura promedio de una ciudad es de 20 grados centígrados, con una varianza
de 4 grados centígrados:
i) Cual es la probabilidad de que esta ciudad tengan 20 ó menos grados
centígrados de temperatura
ii) Si el valor de x estandarizado fuera de 0, cuál sería la probabilidad de tener
menos de ese valor como temperatura en la ciudad?
iii) Cual sería el valor estandarizado (z) para una probabilidad acumulada de 0.5
partiendo desde la izquierda.
iv) Cual sería el valor de la temperatura para ese punto?
4) Un tanque de agua se llena en un promedio de 15 minutos. Cual es la probabilidad de
que ese tanque se llene en más de 6 minutos?
6) Con los siguientes datos buscar un modelo matemático que permita predecir el precio de
las casas en función de su número de cuartos.
Precio Número
Casa Venta cuartos
1 90.4 8
2 127.3 9
3 109.6 8
4 131.2 12
5 81.3 6
6 107.9 10
7 135.8 11
8 97.8 7
9 116.7 10
10 164.8 14
11 88.8 7
12 120.5 11
13 109.8 10
a) Existirá una buena relación entre variables?
b) El ajuste del modelo matemático es bueno?
c) Cuál será el modelo matemático?
d) Cual sería el precio de venta para una casa de 5 cuartos?
3.6. INFERENCIAS RESPECTO A LOS PARAMETROS
DE POBLACION EN REGRESION Y CORRELACION
3.6.1. INTRODUCCION. Cuando se realizan análisis de regresión y correlación es necesario contar con
cierto grado de confiabilidad de que las predicciones y las relaciones entre “X y Y” sean
estadísticamente aceptables y para ello se usa la inferencia estadística para llegar a conclusiones
acerca de la pendiente “b” y del coeficiente de correlación de la población, “r”. Analizaremos tres
tipos de pruebas para este fín.
a) Pendiente verdadera igual a cero: Podemos determinar si existe una relación significativa entre las
variables X y Y al probar si “b” (pendiente de la ecuasión lineal) es igual a cero. Si esta hipótesis es
rechazada se puede llegar a la conclusión de que existe evidencia de una relación lineal. Las hipótesis
nula y alternativa se pueden establecer de la manera siguiente:
Ho : 1 = 0 ( No hay relación )
Ha : 1 0 ( Hay relación )
b1 − 1
t=
Sb1
En donde:
S yx
Sb1 = −
x2 − n x2
Del ejemplo que hemos venido desarrollando entre el número de clientes y ventas semanales
x = 731.15 y = 8.8055
0.497 0.497
Sb1 = = = 0.000634
11,306,209 − 20(731.15) 2
614,603
b1 0.00873
t= = = 13.77
S1 0.000634
Regla de Decisión: Si t calculado t tabla se rechaza la hipótesis y como 13.77 2.1009 rechazamos la
hipotesis nula y por tanto indicamos que si existe relación entre las dos variables ya que 1 no es igual a 0,
por tanto la pendiente es mayor que 0.
- 28 –
b) Establecer un intervalo de confianza para 1 y deteinar si el valor 1 (supueso igual a cero) está
incluido en este intervalo.
La estimación de intervalo de confianza se obtendría mediante la siguiente fórmula:
b1 t Sb1
Si se deseara una estimación de intervalo de confianza del 95% tendríamos b1= 0.00873, t18 = 2.1009,
Sb1 = 0.000634
REGLA DE DECISION. Los valores del intevalo de 1 están por arriba de 0, esto hace concluir que
existe relación lineal significativa, por tanto podemos llegar a la conclusión de que existe una relación
lineal significativa entre las ventas semanales y el número de clientes.
c) Determinar si existe alguna correlación significativa entre las variables haciendo la Hipótesis que el
coeficiente de correlación de la población “p”
El estadístico dce prueba para determinar la existencia de una correlación significativa esta dada por:
r−p
t=
1− r2
n−2
En el ejemplo de los almacenes:
0.956 0.956
t = = = 13.75
1 − 0.913 0.0695
20 − 2
- 29 -
3.7. MODELO DE REGRESION MULTIPLE.
3.7.1. INTRODUCCION.
Algunas veces se dá el caso de que se puede desarrollar un modelo que se ajusta mejor si se toma en cuenta
más de una variable explicatoria en cuyo caso estaríamos desarrollando un modelo de Regresión multiple.
3.7.2. DESARROLLO.
En un análisis de correlación multiple se pueden tomar en consideración muchas variables explicatorias para
simplificar consideraremos solamente dos, con estos datos podemos construir una grafica tridimensional
(diagrama de dispersión).
115.375
120.75
126.126
131.501
136.876
142.251
147.626
153.002
158.377
163.752
above
- 30 -
Ejemplo: Amy Green presidenta de la compañía Green Garden quiere ver si el volumen semanal de ventas de
su empresa se relaciona con algunas variables. Primero con una regresión simple relaciona las ventas con el
número de anuncios semanales en televisión de la compañía, con esto explica el 91.3 % de la varianza en las
ventas a través de la relación lineal ( r = 0.956 ) , para reducir la varianza debida al error analiza la
temperatura promedio semanal como otra variable los resultados son:
1089 = 8 bo + b1 33 + b2 432
4608 = bo 33 + b1 145 + b2 1928
61088 = bo 432+ b1 1928 + b2 27036
Con este modelo nosotros podemos ya predecir, por ejemplo si queremos predecir las ventas semanales
especificando que el número de comerciales es de 4 (X1) y la temperatura ambiental promedio de la semana
es de 70 (X2).
¿Cómo afectaría a las ventas el aumento de un comercial a la semana si la temperatura ambiental promedio se
mantuviera constante?
- 31 -
TEORIA ELEMENTAL DE PROBABILIDADES
Por: Samuel Reyes
[Link].
La teoría de la probabilidad proporciona la base para la inferencia estadística, debido a que la estadística
inferencial, tiene entre sus objetivos “cuantificar la incertidumbre que caracteriza a todo proceso en el que se
avanza de lo particular a lo general”. La probabilidad es la posibilidad u oportunidad de que suceda un evento
particular.
a) Enfoque subjetivo. Este enfoque es adecuado cuando solo hay una oportunidad de ocurrencia del evento y
ocurrirá ó no ocurrirá esa sola vez. Es el grado de creencia por parte de un individuo de que un evento ocurra
basado en toda la evidencia a su disposición. También se le llama probabilidad personalista. Ej. si un equipo de
administración piensa que hay una probabilidad de 0.35 de que un nuevo producto tenga éxito en el mercado.
c) Enfoque clásico ó a priori. Este enfoque permite la determinación de los valores de la probabilidad antes
de observar cualquier evento y se basa en la suposición de que cada resultado es igualmente posible.
Sea :
E un evento determinado
n número de casos posibles
h numero de caso favorables a la ocurrencia del evento
Entonces:
La probabilidad de ocurrencia del evento E está dado por:
p= h = p (E)
n
_
Sea: E el evento complementario de E
La probabilidad de no ocurrencia del evento E está dado por:
_
q= n-h = p (E)
n
_
Por tanto: p+q=1 p (A) + p (A) = 1
EVENTO CIERTO = p= h = 1
n
EVENTO IMPOSIBLE = p= h = 0
n
Por tanto: 0 p 1
[Link] MUESTREAL:
También se le llama: espacio de eventos. Es el conjunto de todos los eventos posibles. Ejemplos: -
Lanzamiento de un dado S= { 1, 2, 3, 4, 5, 6 } n = 6
Cartas de una baraja estándar n = 52, hay cuatro palos ( espadas, corazones, treboles y diamantes), cada uno
de los cuales tiene 13 cartas diferentes (as, rey, reina, sota, 10, 9, 8, 7, 6, 5, 4, 3, 2, ).
[Link] Ó SUCESO:
Subconjunto del espacio muestral, que puede ser desde un punto del espacio muestral hasta el espacio muestral
completo. Por Ej. El evento de las cartas por palo: E = { espada, corazón, trebol y diamante } ; En el
lanzamiento de un dado: que el resultado sea un número par: E = { 2, 4, 6 }.
El complemento del evento E incluye todos los eventos que no son parte del evento E. Está dado por el
simbolo E'.
[Link] CONJUNTA.
Se refiere a fenómenos que contienen dos ó más eventos, como por ejemplo la probabilidad de que al escoger
una carta obtengamos un as negro.
a) Eventos mutuamente excluyentes. Se da cuando ambos eventos no pueden ocurrir al mismo tiempo. (si
ocurre un evento el otro no puede ocurrir, aunque ambos tienen la probabilidad).
Ejemplo: Moneda ( cara ó escudo), Ganar ó perder, hombre ó mujer, día ó noche, encendido ó apagado.
P (A ó B) = P (A) + P (B) = P (A U B)
También se les llama: “eventos incompatibles”.
Ejemplo. Determinar la probabilidad de sacar un as, un rey ó un 10 de una baraja.
P = 4/52 + 4/52 + 4/52 = 12/52 = 3/13
b) Eventos no mutuamente excluyentes. En este caso si pueden ocurrir eventos al mismo tiempo. Ejemplo:
probabilidad de ganar el examen con 90.
Probabilidad de sacar un 10 y de corazones
P (A ó B) = P (A) + P (B) – P (A B)
P (A y B) = P (A B) = p (A) * P (B A)
(La raya vertical significa dado que)
4.10.1. INTRODUCCION. La distribución normal es de vital importancia en estadística por tres razones
principales:
a) Numerosos fenómenos continuos parecen seguirla ó pueden aproximarse mediante ésta.
b) Podemos usarla para aproximar diversas distribuciones de probabilidad discreta y evitar así pesados
cálculos.
c) Proporciona la base de la inferencia estadística clásica debido a su relación con el teorema del
límite central.
La distribución normal es una distribución continua que tiene forma de campana y está determinada por
su media y su desviación estándar. (es más probable que una observación esté cerca de la media del
conjunto de los datos que lejos ).
La siguiente figura muestra la forma de una curva normal típica. Observe que la curva es simétrica; la
mitad del área bajo la curva está a la derecha de la media y la mitad a la izquierda, lejos de la media hacia
cualquiera de las colas, la altura de la curva disminuye. Esto corresponde a una probabilidad decreciente
de encontrar un valor mientras más lejos esté de la media. La distribución normal teórica tiende al
infinito en los extremos positivo y negativo de la curva. En la práctica este aspecto se ignora ya que la
probabilidad de que ocurra una observación es muy pequeña cuando aumenta la distancia de la media.
4.10.2. PROPIEDADES.
a) Tiene forma de campana y es simétrica en apariencia.
b) Sus mediciones de tendencia central (media, mediana, moda) son todas idénticas.
c) Su variable aleatoria asociada tiene un alcance infinito. ( - X + ) .
d) El área total bajo la curva es igual a 1.0, o 100%. El 50% del área está a la derecha de la media y el
50% a la izquierda.
e) Cada combinación de la media y la desviación estándar específica una distribución normal única.
f) La probabilidad de que una variable aleatoria tenga un valor entre cualquiera dos puntos es igual al
área bajo la curva entre esos puntos. Esta área se puede determinar usando el cálculo ó la tabla
normal estándar.
g) La curva normal tendrá en su punto más alto la medía aritmética y es cuando z = 0.
h) El valor de la curtosis es igual a 3.
i) Cuando z= 0 y = 0.39894
e −(1 / 2)( x − x / x
1 2
p( X ) =
2 x
Donde:
X − x
z=
x
El valor z es una medida del número de desviaciones estándar entre la media ó centro de la curva normal
y el valor de interés.
Ejemplo 1. Una curva normal tiene una media igual a 500 y una desviación estándar igual a 25. Un
analista quiere encontrar las áreas bajo la curva normal, tanto abajo como arriba del valor 535. ¿Cuál es el
valor de z correspondiente a 535?.
1 − (1 / 2) z 2
f (Z ) = e
2
Por tanto podemos convertir cualquier conjunto de datos normalmente distribuidos a su forma
estandarizada y después determinar cualquier probabilidad deseada a partir de una tabla de la distribución
normal estandarizada.
Ejemplo 2: Una distribución normal tiene una media de 5 y una desviación estándar de 2.1 ¿Cuál es la
probabilidad de que un valor numérico generado de manera aleatoria a partir de esta distribución esté
entre 5 y 6? En la figura se ve el área deseada, estandarizando tenemos que z= (6-5)/2.1 = 0.48
Como el área deseada se extiende de la media de la curva (5) a un punto de interés x (6) el área deseada se
puede leer directamente en la tabla normal estándar usando el valor calculado de z. La columna de la
izquierda de la tabla normal estándar enumera los valores z con sólo un dígito de cada lado del punto
decimal. Como el valor de z es 0.48 se usa la fila de 0.4, los valores de la cabecera de cada columna dan
el segundo dígito a la derecha del punto decimal. Como este dígito es 8, se usa la columna de .08. El
elemento de la tabla donde se cruzan la fila 0.4 y la columna 0.08 es el valor .1844. Por tanto la
probabilidad de obtener un valor entre 5 y 6 es igual al 18.44 %.
Ejemplo 3. ¿Qué porcentaje de los valores de una curva normal puede esperarse que esté a menos de 1, 2,
ó 3 desviaciones estándar de la media? La tabla normal se lee con z= 1, z=2, y z=3 y las áreas se
determinan siguiendo el proceso, después se duplican para tomar en cuenta los valores a la derecha y a la
izquierda de la media.
Z = 1: (.3413) (2) = .6826
Z= 2 : (.4772) (2) = .9544
Z= 3 : (.4987) (2) = .9974
P24/Samuel Reyes
Ejemplo 4. Encontrar el área bajo la curva normal en cada uno de los siguientes casos: (Utilizar la tabla
de probabilidad normal)
a) Entre z = 0 y z = -0.76 Por simetría
el área pedida = área entre z = 0 y z = 0.76
Al observar la gráfica vemos que ésta área se calcula
Directamente y es igual a: p = 0.2764.
Ejemplo 5. Determinar el valor ó valores de z en cada uno de lo siguientes casos, donde el área dada se
refiere a una curva normal.
La empresa Grear Tire Company acaba de desarrollar un neumático radial con banda de acero que
venderá a través de una cadena nacional de tiendas de descuento. Como ese neumático es producto
nuevo, la dirección de Grear cree que la garantía de millas recorridas que se ofrece con el neumático será
un factor importante en la aceptación. Antes de formalizar esa política, la dirección desea contar con
información acerca de las millas que duran los neumáticos.
En pruebas reales en carretera, el grupo de ingeniería de Grear ha estimado que el promedio de distancia
recorrida es μ = 36,500 millas y que la desviación estándar es σ = 5,000. Además los datos reunidos
indican que la adopción de la distribución normal es una hipótesis razonable. ¿Qué porcentaje de
neumáticos se puede esperar que duren más de 40,000 millas? En otras palabras.¿Cuál es la probabilidad
de que las millas recorridas rebasen las 40,000?.
Ahora supongamos que Grear planea una garantía según la cual el usuario recibirá un descuento en sus
neumáticos de repuesto, si lo neumáticos originales no rebasan la distancia en millas especificadas en la
garantía ¿cuáles deben ser las millas recorridas para que no haya más de 10% de los neumáticos que
aprovechen el descuento en la garantía?.
El 40% del área debe estar entre la media y las millas recorridas, según la garantía, que por el momento se
desconocen. Buscamos .4000 en el cuerpo de la tabla y vemos que esa área está aproximadamente a 1.28
desviaciones estándar debajo de la media. Esto es z = 1.29 es el valor de la variable aleatoria normal que
corresponde a la garantía deseada de millas recorridas en la distribución normal para Grear Tire. Para
calcular x, la distancia recorrida que corresponde z = -1.28, hacemos lo siguiente:
x−
z= = −1.28
x − = −1.28
x = − 1.28
En consecuencia una garantía de 30,100 millas cumplirá con el requisito de que aproximadamente el 10%
de los neumáticos sean elegibles para aprovechar la garantía. Quizá con esta información la empresa
establezca en 30,000 su garantía de milla recorridas.
LABORATORIO SOBRE DISTRIBUCION NORMAL
X 1 , X 2 , X 3 ,.............. X n
Con probabilidades:
P1 , P2 , P3 ,.................Pn
P1 , P2 , P3 ,.................Pn
Respectivamente, en correspondencia con los valores
X 1 , X 2 , X 3 ,.............. X n
Ejemplo:
Hallar la probabilidad que en las familias con tres hijos, existan hombres y mujeres entre ellos,
suponiendo igual probabilidad de nacimientos para cada sexo:
Definimos: M = evento “hijo hombre”
F = evento “hija mujer”
P (M) = P (F) = ½
Posibilidades:
a) Que tenga 3 hijos hombres: P (MMM) = P (M)* P (M) * P(M) = 1/2*1/2*1/2 = 1/8
( eventos independientes)
b) Que tenga 3 hijas mujeres : P (FFF) = P (F) * P (F) * P (F) = 1/2*1/2*1/2 = 1/8
( eventos independientes)
c) Que tenga 2 hombres y 1 mujer: P (MMF + MFM + FMM)
= P (MMF) + P (MFM) + P (FMM)
= 1/2*1/2*1/2 + 1/2*1/2*1/2 + 1/2*1/2*1/2 = 1/8 + 1/8 + 1/8 = 3/8
(La estructura de cada grupo depende del lugar que ocupa la hija mujer en la familia; en esta fase los
eventos son mutuamente excluyentes; en cada grupo específico, los eventos son independientes).
d) Que tenga 2 hijas mujeres y un hombre: P (FFM + FMF + MFF) =
= P (FFM) + P(FMF) + P (MFF)
= 1/2*1/2 * 1/2 + 1/2 *1/2* 1/2 + 1/2*1/2*1/2 = 1/8
Sea X la variable casual que representa el número de hijos hombres en familias con 3 hijos, la
correspondiente distribución de probabilidad p (X), es la siguiente:
PROBABILIDAD DE H IJOS
0.4
PROB.
0.3
0.2
0.1
0
0 1 2 3 4
HIJOS
Porque X asume esos valores discretos, con determinada probabilidad, se le llama Variable Casual discreta
ó Variable Estocástica Discreta.
Si acumulamos los valores de probabilidad obtenida para cada valor de X, tendremos una distribución
acumulada de probabilidad, cuya función asociada se llama Función de Distribución; la cuál se representa con
F (X).
Ejemplo: En el mismo caso visto anteriormente, es decir, X es la variable casual del número de hijos
hombres en familias con 3 hijos; tendremos:
X= 0 , 1 , 2 , 3
P (x) = 1/8 , 3/8 , 3/8 , 1/8
F (x) = 1/8 , 4/8 , 7/8 , 8/8
Si una variable X puede asumir un conjunto continuo de valores (a, b), siguiendo una determinada ley de
probabilidad Y = p (x), entonces llamamos a X con el nombre de variable Casual continua o variable
Estocástica continua y a p(X) la llamamos como una distribución continua de probabilidad de X, o más
corrientemente una función de Densidad de la Probabilidad.
Ejemplo gráfico: Hallar la probabilidad de que X caiga entre los valores a y b = p (a< x <b)
La solución está representada por la parte sombreada en la gráfica siguiente. (suponemos conocida la ley de
probabilidad ó función de densidad Y = p (x)
a b
b
Ejemplo: la función de densidad (distribución ó función de probabilidad continua) asociada a una variable
casual continua X, está dada por:
P (X) = ½ - 1/8 x
Hallar la probabilidad que el valor de x se localice entre los puntos 1 y 2; es decir hallar p (1< x <2).
En este caso la función ó distribución de probabilidad tiene una forma lineal; es decir, Y = p (x) es de tipo
lineal. Graficando obtenemos una línea recta a través de los puntos siguientes:
P (0) = ½ y p (4) = 0
En la gráfica siguiente observamos que la probabilidad deseada está representada por la parte sombreada;
entonces, para conocer que valor tiene esa área, recurrimos a la geometría plana que permite hallar la
superficie de la figura allí observada, la cuál es un trapecio.
A=
bases * altura
2
Aplicando las cantidades que se tienen resulta:
(3 / 8 + 1 / 4)
A= *1 = 5 / 16
2
p(x)=1/2-1/8x
0.6
0.5
0.4
p(x)
0.3 p(x)
0.2
0.1
0
0 1 2 3 4 5
x
.
EJERCICIO POISSON
a) exactamente tres
e−2 (2)3 8
P(3) = = = .18
3! (2.71828)2 (6)
e−2 (2.0)0 1
P(0) = = = 0.1353
0! (2.71828)2 (1)
e−2 (2)1 2
P(1) = = = 0.2706
1! (2.71828)2 (1)
e−2 (2)2 4
P(2) = = = 0.2706
2! (2.71828)2 (2)
e −10 (10) x
P( x) =
x!
5
e −10 (10)5 10 10 = .0378
P(3) = =
5! (2.71828) (5!)
Supongamos que deseamos calcular la probabilidad de una llegada en un período de tres
minutos. Como 10 es la cantidad esperada en un intervalo de 15 minutos, vemos que 10/15
= 2/3 es la cantidad esperada de llegadas en un período de un minuto y que (2/3) (3
minutos) = 2 es la cantidad de llegadas en un período de tres minutos. Entonces la
probabilidad de x llegadas en un periodo de tres minutos con media = 2, se expresa con la
siguiente función de probabilidad de Poisson.
e −2 (2) x
P( x) =
x!
Para determinar la probabilidad de que haya una llegada en un período de tres minutos,
podemos calcularlo así:
e −2 (2)1
P( x) = = 0.2707
1!
Supongamos que se ve que los defectos grandes, un mes después de recubrir la carretera, se
presenta con una frecuencia promedio de dos por milla. Vamos a determinar la
probabilidad de que no haya defectos grandes en determinado tramo de tres millas de la
carretera. Como nos interesa un intervalo de tres millas de longitud, media = (2
defectos/milla) (3 millas) = 6, representa la cantidad esperada de defectos grandes en el
tramo de tres millas de carretera, la probabilidad de que no exista ningún defecto grande en
el tramo de tres millas es:
e −6 (6)0
P( x) = = 0.0025
0!
Es decir que es muy improbable que no haya defectos grandes en el tramo de tres millas.
De hecho, hay una probabilidad de 1 – 0.0025 de que al menos haya un defecto grande en
ese tramo.
4. Al departamento de Reservaciones de Aereolineas Regionales llegan en promedio
48 llamadas por hora:
Media = 48 (5/60) = 4
e −4 (4)3
P( x) = = 0.1952
3!
Media = 48 (15/60) = 12
e−12 (12)10
P( x) = = 0.1048
10!
e −4 (4)0
P( x) = = 0.0183
0!
e−2.4 (2.4)0
P( x) = = 0.0907
0!
3. MEDIDAS DE DISPERSION
Mide la propagación total en la serie de datos, es una medición simple y de fácil cálculo
pero su debilidad es que no logra tomar en cuenta la forma en que los datos se
distribuyen realmente entre el mayor y el menor valor.
Usando los datos del ejemplo 1. (página 5): 2, 4, 5, 6, 7, 9, 10, 12 El Rango sería:
R= 12- 2 = 10
3.2.2. DESVIACION MEDIA. Dado un conjunto de datos tales como X1, X2,....XN, la
desviación media se define como el promedio aritmético de las respectivas desviaciones
absolutas con respecto a la media.
n −
/ Xi − x /
DM = i =1
n
DM= /2-6.875/ + /4-6.875/ + /5-6.875/ + /6-6.875/ + /7-6.875/ + /9-6.875/ + /10-6.875/ + /12-6.875/
8
DM = 2.625
( xi )
2
(x − x)
− 2
x 2
i −
n
= =
2 i
s
n n
- 11 -
Con los datos del ejemplo 1 tenemos:
Sumatoria Xi= 55
Sumatoria Xi^2 = 455
55 2
455 −
s2 = 8 = 9.6093
8
3.2.4. LA DESVIACION STANDARD. El cálculo de la varianza, se hace utilizando datos
cuadráticos con el objetivo de que las desviaciones no se cancelen entre sí, por esta
razón, es necesario trabajar con valores originales (no elevados al cuadrado) y esto se
logra con la desviación standard. El cálculo de la desviación standard a partir de la
varianza, es simplemente obtener la raíz cuadrada de esta última.
s 2 = 9.6093 = 3.10
Propiedades:
a) El 68.27% de los datos de una distribución, están a una desviación standard de la
media.
b) El 95.45% de los datos de una distribución, están a dos desviaciones estándar de la
media.
c) El 99.73% de los datos de una distribución, están a tres desviaciones standard de la
media.
D.M . =
F / x− x/
n
Siguiendo el ejemplo de la tabla 2 tenemos:
DM= 1183.95
100
DM= 11.8395
− 2
s2 =
f ( x − x)
n
23874.75
s2 = = 238.7475
100
s = 238.7475 = 15.45146
15.45146
C.V . = *100 = 28.01715
55.15
- 13 -
3. ANALISIS DE REGRESION Y CORRELACION
3.1. INTRODUCCION. En la realidad cotidiana encontramos muchos fenómenos donde se observa que
existe una relación entre dos ó más variables por ejemplo: a) número de clientes y ventas semanales.
b) cantidades de ventas hechas por varios vendedores y los años de experiencia de cada vendedor.
Con el fín de expresar esta relación en forma matemática (ecuación que relacione las variables)
hacemos uso del análisis de regresión “el cuál básicamente se utilizará para hacer predicciones”, el
objetivo es predecir los valores de una variable repuesta ó dependiente (a menudo se identifica
con la letra “y” ) basados en los valores de una variables independiente ó explicatoría (que por
lo general se identifica con la letra “x”), y para medir la intensidad de la asociación de las
variables se usará el análisis de correlación”.
3.2. DIAGRAMA DE DISPERSION. (Diagrama de esparcimiento ó nube de datos) El primer paso del
análisis de regresión es coleccionar los datos indicando el valor de las variables (tabla 1.) y se
representa en un sistema de coordenadas cartesianas, al conjunto de estos puntos se le llama:
diagrama de dispersión (ver gráfica).
15
Ventas semanales
10
0
0 500 1000 1500
Número de clientes
- 24 -
En este diagrama observamos una línea que representa aproximadamente los datos, a la cuál se le
denomina: “línea interpolante”.
3.3. TIPOS MODELOS DE REGRESION. La naturaleza de la relación puede tomar formas desde las
más sencillas hasta la funciones matemáticas complicadas. La más sencilla es la relación lineal como la
del ejemplo y que se representa por: Y = a + bx + error
El modelo matemático apropiado que se debe seleccionar está influenciado por la distribución de los
valores de x y y en el diagrama de dispersión, como ejemplo tenemos los siguientes de la gráfica de abajo.
En el panel A sería como el ejemplo, en el B que sería una relación lineal negativa, un ejemplo podría ser
el precio de un producto y las ventas. En el panel C no observamos ninguna relación entre variables. El
panel D muestra una relación curvilínea positiva entre X y Y. Los valores de y aumentan al aumentar x
pero luego este incremento disminuye cuando se sobrepasan ciertos valores de x, un ejemplo podría ser
la edad y el costo de mantenimiento de una máquina, el panel E muestra una relación parabólica ó en
forma de U, entre X y Y. Conforme aumenta X al principio Y disminuye pero a medida que X sigue
incrementándose y no solamente deja de disminuir sino que en realidad aumenta por encima de su valor
mínimo. Un ejemplo podría ser el número de errores por hora cometidos en una cierta tarea y el número
de horas trabajadas en ella. En el panel F se presenta una relación exponencial ó curvilínea negativa, Y
disminuye rápidamente en la medida que X aumenta, pero luego la disminución se hace más lenta
conforme X sigue aumentando. Un ejemplo sería el valor de reventa de un tipo particular de automóvil
con respecto a su antigüedad.
90 90
80 80
70 70
60 60
50 50
Ser i e1 Ser i e1
40 40
30 30
20 20
10 10
0 0
0 2 4 6 8 10 0 2 4 6 8 10
A F
90
80
80
70
70
60
60
50
50
Ser i e1 40 Ser i e1
40
30 30
20 20
10 10
0 0
0 2 4 6 8 10 0 2 4 6 8 10
B C
90
6000 80
70
5000
60
4000 50
Ser i e1
40
3000
30
2000 20
10
1 000
0
0 0 5 10 15 20 25
0 20 40 60 80
D E
- 25 -
3.4. USO DE ECUASIONES NORMALES.
3.5. ERROR ESTÁNDAR DE LA ESTIMACION.
3.6. METODO DE MINIMOS CUADRADOS. El Tipo mas simple de curva de regresión es el de la
línea recta, aunque como ya vimos pueden existir otros tipos, lo que al final buscamos es encontrar
“la línea que mejor se ajusta a los datos” matemáticamente esto significa hallar la línea que
minimice la suma de los cuadrados de las distancias entre la línea del modelo y los puntos de la base
de datos original (medidas en dirección vertical y); para esto se requiere del cálculo diferencial (ver
apéndice B en Estadística para negocios de Hanke). Con las siguientes fórmulas encontraremos la
pendiente (b) y la ordenada al origen de la recta de regresión muestral.
n xy − ( x)( y)
b=
n x 2 − ( x ) 2
a=
y − b x
n n
Donde: x = suma de valores de x.
y = suma de valores y
x^2 = suma de los cuadrados de los valores de x
(x)^2= cuadrado de la suma de los valores de x
xy = suma de productos de x e y para cada observación pareada
n = número de observaciones x-y
Para estos cálculos desarrollamos la siguiente hoja electrónica.
x y xy x^2 y^2
1 907 11.2 10158.4 822649 125.44
2 926 11.05 10232.3 857476 122.1025
3 506 6.84 3461.04 256036 46.7856
4 741 9.21 6824.61 549081 84.8241
5 789 9.42 7432.38 622521 88.7364
6 889 10.08 8961.12 790321 101.6064
7 874 9.45 8259.3 763876 89.3025
8 510 6.73 3432.3 260100 45.2929
9 529 7.24 3829.96 279841 52.4176
10 420 6.12 2570.4 176400 37.4544
11 679 7.63 5180.77 461041 58.2169
12 872 9.43 8222.96 760384 88.9249
13 924 9.46 8741.04 853776 89.4916
14 607 7.64 4637.48 368449 58.3696
15 452 6.92 3127.84 204304 47.8864
16 729 8.95 6524.55 531441 80.1025
17 794 9.33 7408.02 630436 87.0489
18 844 10.23 8634.12 712336 104.6529
19 1010 11.77 11887.7 1020100 138.5329
20 621 7.41 4601.61 385641 54.9081
14623 176.11 134127.9 11306209 1602.0971
20(134127.9) − (14623)(176.1)
b=
20(11306209) − (14623) 2
b = 0.00873
- 26 –
176.11 0.00873(14623)
a= − = 2.423
20 20
La ecuación para la mejor línea recta que se ajusta a estos datos es:
Y = 2.423 + .00873 x
Este modelo de regresión que ha sido ajustado a los datos puede utilizarse ahora para predecir las ventas
semanales. Por ejemplo, digamos que nos gustaría utilizar el modelo para predecir las ventas semanales
de una tienda con 600 clientes. Podemos determinar el valor predicho si hacemos X = 600 en nuestra
ecuación:
Cuando se hacen predicciones fuera del rango de los valores originales se presupone que la relación
ajustada es válida para todos los valores, en donde debe de tenerse cuidado pues el alcance relevante que
teníamos ahora se ha convertido en una extrapolación. Cuando el calculo se realiza dentro del rango
estamos hablando de una interpolación.
n xy − ( x)( y )
r=
n x − ( x ) 2 n y 2 − ( y ) 2
2
20(134127.9) − (14623)(176.11)
r= = 0.9555
20(11306209) − 146232 20(1602.0971) − (176.11) 2
− −2
SST = (Y − Y ) = Y − n Y
2 2
SSE = (Y − Y ) 2 = Y 2 − aY − b XY
−
SSR = ( y − y)2 = SST − SSE
- 27 –
−
SSR = a y + b xy − n y 2
En el ejemplo:
SSE = 1602.0971-(2.423)(176.11)-(0.00873)(134127.90)=4.446
SSR = (2.423)(176.11)+(0.00873)(134127.90)-20(8.8055)^2=46.9145
El coeficiente de correlación puede calcularse también a través de calcular la raíz cuadrada del
coeficiente de determinación. (comprobar esto con el resultado obtenido por la fórmula.
S yx =
( y − yp) 2
n−2
( y −yp) 2
= y 2 − a y − b xy
S yx =
y 2
− a y − b xy
n−2
En el ejemplo:
Con esta información podríamos construir intervalos de confianza para la ecuación sumándole el valor
(Syx) (z) a la ecuación encontrada. El z variará dependiendo del nivel de confianza que deseemos.
LA DISTRIBUCION BINOMIAL
Es una distribución de probabilidad discreta que implica la posibilidad de obtener x éxitos en n pruebas
de un experimento binomial.
Un buen ejemplo de un experimento binomial es el de lanzar una moneda al aire varias veces. Sólo hay
dos resultados posibles en cada prueba ó tirada de la moneda (cara ó escudo), la probabilidad de obtener
cara ó escudo sigue constante de una tirada a otra (0.5 para cada una) y las tiradas son independientes
entre sí.
Ejemplo. Cuál es la probabilidad de que se obtengan dos caras al lanza una moneda tres veces. Un
método para calcular la probabilidad en una situación así es usar un diagrama de árbol.
Cada rama representa una tirada. La regla de la multiplicación se usa para calcular la probabilidad de
cada manera independiente en la que pueden salir dos caras. Observe que cada manera de obtener dos
caras tienen la misma probabilidad. La regla de la suma se usa después para calcular la probabilidad final
de obtener dos caras: esta probabilidad es .375.
El segundo método es mediante el modelo de distribución binomial el cuál requiere de tres valores:
a) El número designado de éxitos ( X )
b) El número de ensayos ú observaciones ( N )
c) La probabilidad de éxitos en cada ensayo ( p ). El fracaso = q = P - 1
3 3!
p( X )=3 C2 0.52 (0.5)3− 2 x = ( )0.52 (0.5)3− 2 = 0.520.53− 2
2 2!(3 − 2)!
El resultado es 0.375. p 19/SR
Otro método utilizado es el de la tabla binomial La tabla binomial se divide en bloques uno por cada
valor de n, el número de pruebas ( usaremos en este curso una tabla de 30 bloques con sus respectivos
posibles valores de x). Los encabezados de las columnas representan los valores de p que van desde 0.1
hasta 0.5. Al leer las probabilidades en la fila x y la columna p apropiadas (del bloque n correspondiente)
se evita tener que resolver la fórmula binomial. En nuestro ejemplo buscamos el bloque n = 3,
intersectamos la fila de x = 2 con la columna correspondiente a p = 0.5 y obtendremos el mismo 0.375
que hemos obtenido por los otros dos métodos.
4.9.1. PROPIEDADES.
Ejemplo: Se tiene un saco con 5 bolas; un blanca y cuatro [Link] se extrae una bola es reemplazada
por otra igual. Cuál es la probabilidad que en 3 extracciones sucesivas: a) se extraigan 3 bolas blancas, b)
dos bolas blancas, c) una bola blanca, y d) 0 bolas blancas.
Los resultados de este ejemplo se obtienen aplicando la distribución binomial estudiado ( en este caso p=
0.20)
X= 0 , 1 , 2 , 3
SERIE 1 P (x)= 0.512 , 0.384 , 0.096, 0.008
Si suponemos que n = 8 en este ejemplo, las extracciones tienen las siguientes probabilidades:
SERIE 2 X= 0 , 1 , 2 , 3 , 4 , 5 , 6 , 7 , 8
P (x) = 0.1678 , 0.3355, 0.2936, 0.1468, 0.0459, 0.0092, 0.0011, 0.0001, 0.0000
0.4
1
0.3 2
P (x)
0.2
0 3
0.1
4
0 5 6 7 8
0 5 10
X
SERIE 3
Comprarando las anteriores dos gráficas con la de n = 20 tendríamos:
0.6
0.4 Serie1
p (X)
0.2 Serie2
0 Serie3
-0.2 0 10 20 30
X
OBSERVACIONES:
0.6
0.4 Serie1
P (X)
0.2 Serie2
0 Serie3
-0.2 0 5 10 15
OBSERVACIONES:
a) Si los valores de n son constantes, los cambios de p afectan la curva y a medida que se aparta p de 0.5
en más ó en menos, la forma de la curva tiende a ser más asimétrica.
b) Para p = 0.5 la curva es simétrica, cercana a la curva normal.
Si p es la probabilidad de que una persona reciba una suma de dinero S, la esperanza matemática
ó simplemente la esperanza se define como pS.
piXi = pX
i =1
Si las probabilidades pi en esta esperanza se sustituyen por las frecuencias relativas fki/N, donde
N =fi, la esperanza se reduce a ( fX / N), que es la media aritmética de una muestra de tamaño N, en
la que X1, X2, ......Xk aparecen con estas frecuencias relativas. Cuando N crece, las frecuencias relativas
fi / N se aproximan a las probabilidades pi. Esto conduce a interpretar que E (X ) representa la media de
la población de la que se ha extraído una muestra. Se denota por m la media de la muestra, la media de
la población vendrá representada por la correspondiente letra griega .
DISTRIBUCION NORMAL EN EXCEL.
Samuel Reyes
c) Para ambas fórmulas si deseamos la probabilidad del punto hacia arriba (hacia
el lado derecho) el resultado que obtenemos en a ó b debemos de restarlo de 1 que
es la probabilidad completa.
1. Se ha comprobado que el tiempo de vida de cierto tipo de máquina sigue una distribución
exponencial con media de 16 meses. ¿Cuál es la probabilidad de que una empresa que la
usa deba sustituirla antes de 20 meses?
1
f ( x) = e − 20 / 16
16
p( x xo ) = 1 − e −20 / 16 = .7135
p( x xo ) = 1 − e − x / 140 = .90
e − x / 140 = 1 − .90
x
= ln 0.1
− 140
x = 322 días
[Link] tiempo entre llegadas de vehículos a determinado crucero sigue una distribución
exponencial de probabilidad, con una media de 12 segundos.
a. ¿Cuál es la probabilidad de que el tiempo entre las llegadas de dos vehículos sea de
12 segundos ó menos?
1 −x /3
f ( x) = e para x mayor o igual que 0.
3
p( x xo ) = 1 − e− x / 3
b. Determine p ( x ≥ 3).
p( x 30 = 1 − p( x 3)
= 1 − (1 − e − 3 / 3 )
= 0.3679
c. Determine p ( 2 ≤ x ≤ 5).
P (x ≤ 5) – p( x ≤ 2)
=.8111 - .4866
= 0.3245
d. Determine p (x ≤ 2).