2. PROBABILIDAD.
En Estadı́stica, la palabra experimento designa todo acto que proporcione unos datos.
Un experimento se dice determinista si al realizarlo sucesivas veces en las mismas condiciones se
obtiene siempre el mismo resultado. Durante siglos, la Ciencia se ha centrado en descubrir las leyes
que rigen los fenómenos deterministas (por ejemplo, los estudiados por la Mecánica).
Un experimento se dice aleatorio si su realización sucesiva en las mismas condiciones produce resulta-
dos posiblemente distintos cada vez. Son fenómenos aleatorios: rendimiento de una semilla, duración
de la vida de una componente, consumo mensual de energı́a en una casa, resultado de lanzar una
moneda, etc.
El resultado concreto que se vaya a obtener en una realización individual del experimento aleatorio
es, a priori, impredecible; sin embargo, el conjunto de todos los posibles resultados indivisibles debe
poder describirse por completo antes de realizar el experimento. Dicho conjunto recibe el nombre de
espacio muestral asociado al experimento aleatorio. Al espacio muestral lo representaremos con la
letra Ω, y a sus elementos, que se llaman puntos muestrales, los denotaremos ω.
El espacio muestral puede ser finito o infinito. Por ejemplo:
El espacio muestral para el experimento de tirar una moneda es finito; Ω = {cara, cruz}.
El espacio muestral para el número de averı́as de una máquina en un determinado intervalo de
tiempo es teóricamente infinito, aunque numerable (puede tener ninguna, 1 2, 3, ... averı́as).
El espacio muestral para la medida del diámetro interior de un determinado tipo de rodamientos
es también infinito, aunque en este caso, los posibles valores son un intervalo de IR.
Un espacio muestral se dice discreto si la cantidad de resultados posibles del experimento es finita o
numerable (como ocurrı́a en los dos primeros ejemplos); por el contrario, el espacio muestral se dice
que es continuo si el conjunto de posibles resultados es infinito y no numerable. El tercer ejemplo
corresponde a un espacio muestral continuo.
Llamamos suceso a un subconjunto cualquiera del espacio muestral A ⊂ Ω. Cuando se realiza un
experimento, diremos que ha ocurrido el suceso A si el resultado que se obtiene es un punto ω
perteneciente al conjunto A. Denominamos:
Suceso elemental, a aquellos sucesos que sólo contienen un punto muestral.
Suceso compuesto, al que contiene más de un punto muestral.
Por ejemplo, salir par, impar, múltiplo de 3, etc. son sucesos compuestos correspondientes al
experimento aleatorio de tirar un dado. Salir 3 es un suceso elemental del mismo experimento.
Suceso imposible, a aquel que nunca ocurre, A = ̸ O.
Suceso seguro a aquel que ocurre siempre, A = Ω.
Puesto que los sucesos son, en definitiva, conjuntos, en el trabajo con sucesos podemos aplicar
todas las operaciones y relaciones existentes entre conjuntos; vamos a recordar las más usuales.
25
En las siguientes definiciones se sobreentenderá que A y B son sucesos de cierto espacio muestral Ω.
Complementario de un suceso. Llamamos suceso complementario de A, y se denota por Ac o
bien por A, al formado por los puntos muestrales que no pertenecen a A: Ac = {ω ∈ Ω/ ω ∈
/ A}.
Unión de dos sucesos. Se define la unión de los sucesos A y B, y se denota por A ∪ B, al suceso
formado por todos los puntos muestrales que pertenecen, al menos, a uno de los sucesos:
A ∪ B = {ω ∈ Ω/ ω ∈ A ó ω ∈ B}.
Intersección de sucesos. Se define la intersección de los sucesos A y B, y se denota por A ∩ B
ó por AB, al suceso formado por todos los puntos muestrales que pertenecen a ambos sucesos:
A ∩ B = {ω ∈ Ω/ ω ∈ A y ω ∈ B}.
Inclusión de sucesos. Se dirá que el suceso A está contenido ó incluido en el suceso B si todos los
puntos muestrales de A pertenecen a B. Esto es, A ⊂ B si para todo ω ∈ A se verifica ω ∈ B.
Sucesos incompatibles, disjuntos o mutuamente excluyentes. Se dirá que el suceso A es in-
compatible con el suceso B si no tienen puntos muestrales en común, es decir, si es A ∩ B = ̸ O.
Leyes de Morgan: Para cualesquiera A, B ⊂ Ω, se verifica:
A ∪ B = A ∩ B (El complementario de la unión es la intersección de los complementarios)
A ∩ B = A ∪ B (El complementario de la intersección es la unión de los complementarios)
2.1. Introducción al concepto de probabilidad
A lo largo de la historia se han dado varias definiciones de probabilidad, tratando de superar en cada
caso los inconvenientes de las anteriores.
Si realizamos un experimento N veces, llamamos frecuencia absoluta del suceso A, y lo denotamos
nA
nA , al número de veces que ocurre A, y llamamos frecuencia relativa de A al cociente fr(A) = .
N
La frecuencia relativa satisface las siguientes propiedades:
1. 0 ≤ fr (A) ≤ 1.
2. fr(Ω) = 1.
3. fr(A ∪ B) = fr(A) + fr(B), si A ∩ B = ̸ O. (Esta propiedad es extensiva a cualquier unión
(finita o numerable) de sucesos, siempre y cuando sean disjuntos dos a dos).
Si lanzáramos al aire reiteradamente una moneda perfecta, comprobarı́amos que en la medida que
aumente el número de tiradas, la frecuencia relativa del suceso A = {salir cara} se irá acercando a
1/2. Esto constituye un hecho empı́rico que se conoce como Ley de Regularidad Estadı́stica y que
se puede enunciar del siguiente modo:
“La frecuencia relativa de un suceso se estabiliza cuando el número de experimentos crece
indefinidamente”
26
Definición empı́rica o frecuentista de probabilidad.
Dado un experimento aleatorio, la probabilidad de un suceso A se define como el lı́mite de las
frecuencias relativas de aparición de dicho suceso, al repetir indefinidamente el experimento. Es decir,
nA
p(A) = lı́m fr(A) = lı́m .
N 7→∞ N 7→∞ N
Esta definición, hoy en desuso, es problemática y poco operativa:
No es, en la práctica, posible conocer el valor de nA para cualquier N , lo que no permite un
cálculo real del lı́mite.
Las circunstancias del experimento pueden variar con el tiempo, y por tanto lo harı́an las fre-
cuencias, y el valor de la probabilidad.
El suceso puede ocurrir una sola vez. (Por ejemplo, la probabilidad de que un determinado avión
se estrelle no es calculable de esta forma).
También hay problemas con respecto al concepto matemático de lı́mite.
Definición de probabilidad según Laplace.
Si en un experimento aleatorio se pueden dar N resultados igualmente posibles y mutuamente
excluyentes (es decir, dos cualesquiera no pueden darse a la vez) y si nA de estos N resultados tienen
la caracterı́stica A, se define la probabilidad de A como:
nA casos favorables
p(A) = = .
N casos posibles
Como ejemplo sencillo, consideremos un instituto en que hay 650 alumnos, de los cuales 170 cursan
Alemán como segunda lengua extranjera. Al elegir al azar un alumno de ese instituto, la probabilidad
170
de que haya resultado elegido un alumno que cursa Alemán es de = 0,26
650
Obviamente, esta definición no es aplicable a otras muchas situaciones, en las que los resultados
no son igualmente probables o no son un número finito.
2.2. Definición axiomática de probabilidad
La definición de probabilidad con la que se suele trabajar es axiomática, y fue introducida en 1933
por el matemático ruso Kolmogorov.
Definición: Sea Ω el espacio muestral asociado a un experimento aleatorio. Una probabilidad en Ω
es una aplicación p, que a cada suceso A le asigna un número real p(A) y que cumple las siguientes
propiedades:
1. Si A es un suceso, entonces se tiene 0 ≤ p(A) ≤ 1.
2. p(Ω) = 1.
3. Si A1 , A2 , . . . , An , . . . son sucesos mutuamente excluyentes (es decir, Ai ∩ Aj = ̸ O si i ̸= j),
(∪ ∞ ) ∑ ∞
entonces p Ai = p(Ai ).
i=1 i=1
27
Puede observarse el total paralelismo entre las propiedades de la probabilidad y las de la fre-
cuencia relativa. En efecto, mientras que la frecuencia relativa es una medida empı́rica de la
ocurrencia pasada de un suceso, la probabilidad es una medida teórica de su ocurrencia en
futuras realizaciones del experimento.
La idea común de probabilidad como “número de casos favorables partido por el número de
casos posibles” introducida por Laplace es un caso particular de la definición de Kolmogorov.
Ante un determinado experimento real, lo que interesa es construir una probabilidad que lo
describa lo mejor posible. Asignar una probabilidad “buena” a un experimento aleatorio es el
problema central de la Inferencia Estadı́stica.
Otras propiedades de la probabilidad:
(∪
n ) ∑n
1. Si A1 , A2 , . . . , An son sucesos mutuamente excluyentes, entonces p Ai = p(Ai ).
i=1 i=1
2. p(Ac ) = 1 − p(A) para todo suceso A.
3. En particular, p( ̸ O) = 0.
4. Si A ⊂ B entonces p(A) ≤ p(B).
5. p(A ∪ B) = p(A) + p(B) − p(A ∩ B).
Asignación de probabilidades en la práctica.
La definición axiomática de probabilidad no proporciona en la práctica un método para asignar proba-
bilidades a los resultados de un experimento aleatorio. Para ello, en ocasiones puede utilizarse el
método proporcionado por la definición según Laplace; en otras ocasiones puede utilizarse el estudio
de las frecuencias relativas y la definición empı́rica; el método más usado es una combinación de
experimentación y teorı́a.
En cualquier caso, siempre el primer paso que hay que dar es definir con precisión la población
objeto de estudio, el experimento aleatorio y los sucesos posibles. Veamos distintas situaciones:
1. Se pone en marcha un nuevo proceso de producción y durante un tiempo se controla el número
de unidades fabricadas y se registra el número de unidades que resultan fallidas.
[Link]. fabricadas [Link]. fallidas [Link]. fallidas
140 3 0,0214
850 10 0,0118
2300 31 0,0135
4000 57 0,0143
7000 97 0,0139
.. .. ..
. . .
Parece razonable considerar que la probabilidad de que al fabricar una pieza resulte fallida es
de 0.14; y de que resulte aceptable, 0.86.
28
2. Un juego consiste en tirar un dado y observar el resultado. Si este es par, el jugador gana; si
no, pierde. En este caso, los resultados o sucesos elementales son 1, 2, 3, 4, 5, 6, y podemos
asignar probabilidades usando el método de Laplace, de forma que la probabilidad de cualquier
resultado es 1/6. El suceso “par” es un suceso compuesto, formado por los sucesos elementales
2, 4 y 6 (mutuamente excluyentes), luego: p(par) = p(2) + p(4) + p(6) = 63 = 21 .
3. Aunque teóricamente la asignación de probabilidades en el ejemplo anterior es válida, en la
práctica se observa que sólo un 10 % de las veces aparecen el resultado 2, el 4, el 5 y el 6; y,
sin embargo, un 30 % de las veces aparece el resultado 1, y un 30 % el resultado 3. En este
caso, la asignación de probabilidades más correcta deberı́a ser coherente con la experimentación:
p(1) = 0.3, p(2) = 0.1, p(3) = 0.3, p(4) = 0.1, p(5) = 0.1, p(6) = 0.1 y, por tanto,
p(par) = 0.3.
Ejemplo 1: Se lanza una moneda normal tres veces.
1. Describir el espacio muestral subyacente.
2. ¿Cuál es la probabilidad de que exactamente dos tiradas den el mismo resultado?
3. ¿Cuál es la probabilidad de una cara y dos cruces?
4. ¿Cuál es la probabilidad de que las tres tiradas den el mismo resultado?
El espacio muestral de este experimento lo forman los resultados posibles de las tres tiradas:
Ω = {CCC, CCX, CXC, XCC, CXX, XCX, XXC, XXX}, siendo C y X, respectivamente, “cara” y
“cruz” al hacer una tirada. Puesto que la moneda es normal, podemos considerar que los 8 sucesos
son equiprobables y, aplicando la definición de Laplace, asignar a cada uno de ellos probabilidad 18
(N1 , con N=8). Los restantes apartados se responden también aplicando Laplace:
o
p(dos tiradas den el mismo resultado)= n ocasos favorables = 68
n casos posibles
o
p(una cara y dos cruces)= n ocasos favorables = 38
n casos posibles
o
p(las tres tiradas den el mismo resultado)= n ocasos favorables = 28
n casos posibles
2.3. Probabilidad condicionada
Cuando se dispone de información parcial sobre el resultado del experimento, la asignación inicial de
probabilidades debe ser modificada:
Ejemplo 2: El espacio muestral para el experimento “tirar una moneda dos veces”serı́a:
Ω = { CC, CX, XC, XX } (donde C=cara y X=cruz); y al suceso CX le asignarı́amos la probabilidad
1/4 (usando equiprobabilidad).
Sin embargo, si disponemos de la información adicional de que la primera tirada ya se ha realizado
y salió cara, entonces la probabilidad de este suceso serı́a 1/2. ¿Qué diferencia hay entre una situación
29
y otra? La diferencia es que, al disponer de información adicional, el espacio muestral ha cambiado;
ahora es un subconjunto del espacio muestral anterior: Ω ′ = {CX, CC}
Definición: Sea Ω el espacio muestral de un experimento aleatorio, y sean A y B dos sucesos con
p(B) ̸= 0. Se define la probabilidad del suceso A condicionada al suceso B (es decir, a que
haya ocurrido el suceso B) como:
p(A ∩ B)
p(A/B) = .
p(B)
Análogamente, se define la probabilidad del suceso B condicionado por que haya ocurrido A como:
p(A ∩ B)
p(B/A) = , siempre que sea p(A) ̸= 0.
p(A)
Se deduce que es p(A ∩ B) = p(A) · p(B/A) = p(B) · p(A/B) . De hecho, se tiene en general:
p(A1 A2 · · · An ) = p(A1 ) · p(A2 /A1 ) · p(A3 /A1 A2 ) · · · · · p(An /A1 · · · An−1 ) ,
siempre que sea p(A1 · · · An−1 ) ̸= 0. [NOTA: Recuérdese que A1 A2 · · · An significa A1 ∩ A2 ∩ · · · ∩ An ]
La probabilidad condicionada p( - /B ) es una verdadera probabilidad sobre Ω, pues verifica todas las
propiedades de la probabilidad (se puede comprobar fácilmente). Lo que en realidad hace p( - /B ) es
asignar a cada suceso A ⊂ Ω la probabilidad que en el espacio muestral Ω ′ = B tendrı́a el suceso
(A ∩ B ) ⊂ Ω ′ .
Ejemplo 3: Se realiza un lanzamiento de un dado normal. ¿Cuál es la probabilidad de obtener un 1
si se sabe que el resultado ha sido impar?
Llamamos A al suceso “obtener un 1” y B al suceso “obtener un impar”. La probabilidad pedida
es, entonces, p(A/B).
p(A ∩ B) p({1}) 1/6 1
Utilizando la definición, p(A/B) = = = = .
p(B) p({1, 3, 5}) 3/6 3
2.4. Independencia de sucesos
Definición: Dos sucesos A y B del espacio muestral Ω se dice que son independientes, si y solo
si se verifica la igualdad p(B/A) = p(B) . De forma intuitiva, esto significa que la probabilidad de
que ocurra B no se ve modificada por el hecho de que haya ocurrido A.
Cuando los sucesos A y B no son independientes, se dice que son dependientes.
Proposición: Las siguientes condiciones son equivalentes:
(i ) A y B son sucesos independientes.
(ii ) p(A/B) = p(A).
(iii ) p(A ∩ B) = p(A) p(B).
30
Ejemplo 4: En el experimento “tirar un dado equilibrado”, consideramos los sucesos A : “obtener par”,
B : “resultado mayor o igual que 3” y C : “resultado mayor o igual que 4”. Puesto que es:
p({2, 4, 6}) 1 p({4, 6}) 1 p({4, 6}) 2
p(A) = = , p(A/B ) = = , y p(A/C ) = =
p({1, 2, 3, 4, 5, 6}) 2 p({3, 4, 5, 6}) 2 p({4, 5, 6}) 3
concluimos que los sucesos A y B son independientes, mientras que los sucesos A y C no lo son.
La independencia de dos sucesos no es una propiedad intrı́nseca de los mismos, sino que está ligada a
las probabilidades asignadas (si las caras del dado no fueran equiprobables, en el ejemplo anterior se
podrı́an obtener conclusiones distintas acerca de la independencia de A, B y C).
En situaciones prácticas, la propia dinámica del experimento permite en algunas ocasiones asumir
como evidente la independencia entre determinados sucesos (por ejemplo: que la probabilidad de sacar
un 5 en la segunda tirada del dado no está influida por el resultado de la primera tirada).
Ejemplo 5: Se lanza tres veces una moneda trucada, considerando independientes los resultados de
cada tirada. Si la probabilidad de cara es 0.8, contestar a las preguntas del ejemplo 1, es decir:
1. Describir el espacio muestral subyacente.
2. ¿Cuál es la probabilidad de que exactamente dos tiradas den el mismo resultado?
3. ¿Cuál es la probabilidad de una cara y dos cruces?
4. ¿Cuál es la probabilidad de que las tres tiradas den el mismo resultado?
En este caso, las probabilidades de cara y cruz no son iguales; la de cara es 0,8 y, por tanto, la de cruz
(suceso complementario de “cara”) es 0,2 = 1 − 0,8.
El espacio muestral de este experimento es idéntico al del ejemplo 2:
Ω = {CCC, CCX, CXC, XCC, CXX, XCX, XXC, XXX},
pero ahora los sucesos elementales no son equiprobables. Ası́, por ejemplo,
p(CCX) = p(C) p(C) p(X) = (0,8)(0,8)(0,2) = 0,128
mientras que
p(CXX) = p(C) p(X) p(X) = (0,8)(0,2)(0,2) = 0,032.
En las restantes preguntas, como los sucesos elementales son mutuamente excluyentes, se aplica la
propiedad de la aditividad para la unión disjunta:
• p(dos tiradas den el mismo resultado) = p({CCX , CXC , XCC , CXX , XCX , XXC}) =
= p(CCX) + p(CXC) + p(XCC) + p(CXX) + p(XCX) + p(XXC) =
= (0,8)2 (0,2) + (0,8)2 (0,2) + (0,8)2 (0,2) + (0,2)2 (0,8) + (0,2)2 (0,8) + (0,2)2 (0,8) = 0,48
• p(una cara y dos cruces) = p({CXX , XCX , XXC})=
= p(CXX) + p(XCX) + p(XXC) = (0,2)2 (0,8) + (0,2)2 (0,8) + (0,2)2 (0,8) = 0,096
31
• p(las tres tiradas den el mismo resultado) = p({CCC , XXX}) =
= p(CCC) + p(XXX) = (0,8)3 + (0,2)3 = 0,52
Ejemplo 6: Se tira 8 veces la moneda trucada del ejemplo 5. ¿Cuál es la probabilidad de obtener
exactamente tres caras?
En este ejemplo el espacio muestral está formado por puntos muestrales con “ocho letras” C ó X.
Cada resultado con exactamente tres caras tiene probabilidad (0,8)3 (0,2)5 . Para resolver el problema,
se necesita saber cuántos de estos puntos muestrales hay. La respuesta la proporciona el número
combinatorio
( )
8 8!
=
3 3! (8 − 3)!
En general, si n y k son números enteros con n ≥ k, se define el número combinatorio
( )
n n!
= ,
k k! (n − k)!
que proporciona el número de subconjuntos distintos de k elementos que se pueden tomar en un
conjunto de n elementos distintos. En el problema que nos ocupa, es necesario contar cuántos puntos
muestrales con 3 caras existen, es decir, cuántas formas hay de elegir las 3 posiciones (entre las 8
posibles) en las que colocar las tres caras. Por tanto,
( )
8 8!
p(obtener exactamente tres caras) = (0,8)3 (0,2)5 = (0,8)3 (0,2)5 = 0,00912
3 3! (8−3)!
2.5. Teoremas principales en probabilidad
Teorema de las probabilidades totales: Sean A1 , A2 , . . . , An , sucesos mutuamente excluyentes
y de probabilidad no nula, tales que A1 ∪ A2 ∪ · · · ∪ An = Ω.
∑
n
Si B es un suceso en Ω, entonces: p(B) = p(B/Ai ) p(Ai )
i=1
Demostración: Para demostrar este resultado basta escribir el suceso B como:
B = (B ∩ A1 ) ∪ (B ∩ A2 ) ∪ · · · ∪ (B ∩ An ),
unión de sucesos mutuamente excluyentes, y aplicar las propiedades de la probabilidad.
Para finalizar, estudiaremos el teorema de Bayes, que tiene aplicación en el siguiente contexto:
Un experimento se realiza en dos etapas:
- Como resultado de la primera etapa se produce uno de los n sucesos A1 , A2 , . . . , An , mutuamente
excluyentes, con probabilidades que se conocen y cuya suma es 1. (Vamos a llamarlos causas).
- En la segunda etapa pueden obtenerse los resultados B1 , B2 , . . . , Bm (que denominaremos efectos),
cuya probabilidad depende del resultado obtenido en la primera etapa. Se conoce el valor de todas
32
las probabilidades condicionadas p(Bj /Ai ) (es decir, la probabilidad de que se presente el efecto Bj
cuando se ha dado la causa Ai ).
Si al realizar el experimento se observa que el resultado final ha sido Bj , ¿cuál es la probabilidad
de que la “causa” haya sido Ai ? (es decir, ¿cuál es la probabilidad de Ai condicionada por Bj ?)
Teorema de Bayes Sean A1 , A2 , . . . , An , sucesos mutuamente excluyentes y de probabilidad no nula,
tales que A1 ∪ A2 ∪ · · · ∪ An = Ω. Si B es un suceso en Ω de probabilidad no nula, entonces:
p(B/Ak ) p(Ak )
p(Ak /B) = .
∑
n
p(B/Ai ) p(Ai )
i=1
La demostración de este resultado es muy sencilla y se basa en la definición de probabilidad condi-
cionada y en el teorema de las probabilidades totales.
Ejemplo 7: El 60 % de los tornillos producidos por una fábrica proceden de la máquina A, y el 40 %
de la máquina B. La proporción de defectuosos en A es 0,1 y en B es 0,5.
¿Cuál es la probabilidad de que un tornillo de dicha fábrica sea defectuoso?
Encontramos un tornillo defectuoso. ¿Cuál es la probabilidad de que proceda de la máquina A?
En este ejemplo, tenemos un experimento en dos etapas; en la primera, los sucesos son:
A: tornillo fabricado por la máquina A
B: tornillo fabricado por la máquina B
Los valores de las probabilidades de estos sucesos son conocidos: p(A) = 0,6 y p(B) = 0,4.
Los resultados de la segunda etapa son:
D: tornillo defectuoso
D: tornillo no defectuoso
Las probabilidades de estos sucesos dependen del resultado de la primera etapa:
p(D/A) = 0, 1 p(D/B ) = 0, 5
A partir de estos valores podemos determinar también:
p(D/A) = 1 − p(D/A) = 1 − 0, 1 = 0, 9 p(D/B ) = 1 − p(D/B ) = 1 − 0, 5 = 0, 5
El suceso D se puede poner como: D = (D ∩ A) ∪ (D ∩ B), unión de sucesos mutuamente excluyentes;
luego utilizando el teorema de las probabilidades totales:
p(D) = p(D/A) p(A) + p(D/B ) p(B) = (0, 1)(0, 6) + (0, 5)(0, 4) = 0, 26
La otra probabilidad es p(A/D), probabilidad de un resultado de la primera etapa condicionada a un
resultado de la segunda; podemos aplicar el teorema de Bayes para resolverlo:
p (D/A) p (A) (0, 1)(0, 6) 3
p(A/D) = = =
p (D/A) p (A) + p (D/B ) p (B) (0, 1)(0, 6) + (0, 5)(0, 4) 13
33