Estadística en Hidrología Aplicada
Estadística en Hidrología Aplicada
Ejemplo:
: lanzar un dado S = (1, 2, 3, 4, 5, 6)
cada uno de los valores que numeran cada cara del dado, de 1 a 6, es un suceso elemental
Ing. Rec. Hídricos Juan B. Sciortino 41
ELEMENTOS DE HIDROLOGÍA CAPÍTULO 4
CÁTEDRA: HIDRÁULICA APLICADA
4.2.2 Probabilidad
Hay tres escuelas o métodos para su definición.
Clásica o a Priori: Se realiza un , la probabilidad de ocurrencia de un suceso A es la relación entre
el número de casos favorables de ocurrencia y el número de casos igualmente posibles.
P(A) = No. casos favorables / No. casos posibles
En el ejemplo anterior, el No. de casos posibles = 6 S = (1, 2, 3, 4, 5, 6)
para el suceso A = sacar un 2 o un 3; A = (2, 3) No. casos favorables = 2
P(A) = 2/6 = 0,333 = 33,3%
para el suceso A = sacar un 4; A = (4) No. casos favorables = 1
P(A) = 1/6 = 0,167 = 16,7%
Empírica o a posteriori: Se realiza un con “n” pruebas, se llama frecuencia absoluta f(A) al nú-
mero de veces que se presenta el suceso A; la frecuencia relativa h(A) es la relación entre la fre-
cuencia absoluta y el número de pruebas, h(A) = f(A) / n.
A medida que el número de pruebas aumenta, h(A) tiende hacia un valor en forma oscilante,
este valor es la probabilidad de ocurrencia del suceso A.
P A = lim h(A)
n→∞
Ejemplo: Sea un arrojar un dado un número “n” de veces, calcular la frecuencia absoluta y
relativa de ocurrencia del suceso A: sacar el número 6.
P(A ó B) = P(A B) = P(A) + P(B) – P(AB) = 4/40 + 10/40 – 1/40 = 13/40 = 0,325 =32,5%
: extraer dos cartas con reposición
Determinar la probabilidad de que las cartas sean un rey y un as.
A: obtener un rey P(A) = 4/40 B: obtener un as P(B) = 4/40
los sucesos A y B son independientes puesto que se repone la carta que se extrae en primer orden
quedando el mazo sin modificaciones
P(A y B) = P(AB) = P(A) P(B) = 4/40 4/40 = 1/100 = 0,01 =1%
0.2
0
0 1 2 X
Suponiendo que se realizan observaciones de una variable aleatoria determinada (x1, x2,...,
xn), extraídas de una hipotética población infinita, el conjunto de observaciones se denomina mues-
tra; el conjunto de todas las muestras posibles que pueden extraerse de una población se conoce
como el espacio muestral.
Una Distribución de Probabilidades es la correspondencia que existe entre todos los valores
de una variable aleatoria y sus probabilidades de ocurrencia, su expresión matemática se realiza
por medio de una Función de Distribución F(x).
Si la variable aleatoria X es discreta (Figura No.4.1), su función de distribución se define por
la siguiente expresión:
F x = P X≤x = f(xi)
xi≤x
f(xi) función de probabilidad de la variable, se representa en una barra como una unidad de masa.
F xo = P X ≤ xo = f x dx
-∞
f(x): función de densidad de masas,
en este caso no es posible represen- Figura No. 4.2: Función de Distribución de
tar la variable aleatoria en forma de Probabilidades. V.A. Continua
barras porque se trata de un continuo
de puntos.
f x dx 1
-∞
La superficie bajo la curva, comprendida entre dos valores de la variable (x1 y x2 x2 > x1)
representa la probabilidad de que la variable tome un valor dentro del mencionado intervalo.
(Figura No. 4.3).
x2
P x1 ≤ X ≤ x2 = F x2 - F x1 = f x dx
x1
αk= xk f x dx
-∞
Medidas de Tendencia Central:
Esperanza Matemática o Media: Es el momento de primer orden de la variable aleatoria “α 1” y
representa un valor particular alrededor del cual tiende a agruparse la masa de datos, el valor es-
perado de la variable aleatoria.
Para una población:
∞
E x = μ= α1= x f x dx
-∞
Para una muestra de “n” datos de la variable aleatoria, la media se determina:
N
1
Xm= xi
N
1
Mediana: es el valor de la variable aleatoria correspondiente a una probabilidad del 50%,
F(x) = 0,50.
Moda: es el valor más probable de la variable aleatoria
Se denomina momento orden k, centrado con respecto a la media, de una variable aleatoria,
a la siguiente operación:
∞
k
βk= (x – E(x)) f x dx
-∞
Medidas de Dispersión:
Varianza: Es el momento de segundo orden centrado con respecto a la media y representa la va-
riabilidad de la información.
Para una población:
∞
2
σ2 = β2= (x – μ) f x dx
-∞
Al igual que en la varianza, cuando la muestra tiene menos de 30 datos, se divide por (N-1) en
lugar de N.
Cuando ó S es grande la masa está muy dispersa con respecto a la media, a medida que se
acerca a 0 la masa se concentra alrededor de la media.
Coeficiente de Variación: Es un parámetro adimensional que relaciona el desvío con la media y
que puede expresarse en forma porcentual.
σ S
σv= Cv=
μ Xm
Medidas de Simetría:
Asimetría: Se determina con el momento de tercer orden centrado con respecto a la media y re-
presenta la simetría de una distribución alrededor de la media.
∞
3
β3= (x – μ) f x dx
-∞
Coeficiente de Asimetría: A fin de tener una representación adimensional de la simetría y por ende
más apreciable, se divide el momento de tercer orden centrado con respecto a la media por el desvío
estándar elevado a la tercera potencia.
β3 ∑N
1 (xi – Xm)
γ= 3 Cs = a
σ S3
Cuando N < 30 a = N /[(N-1) (N-2)] ; cuando N > 30 a = 1/N
Si γ ó Cs < 0 la mayor concentración de la masa se ubica a la izquierda de la media (hacia
menores), si γ ó Cs > 0, la mayor concentración de la masa se ubica a la derecha de la media (hacia
mayores).
En las Figuras Nos. 4.4 y 4.5 se muestran funciones de densidad de masa con distintos des-
víos y asimetrías respectivamente.
=1
=3
μ=3
γ < 0
Ejemplo de dependencia espacial: dada un batería de pozos de agua que están explotando un
mismo acuífero, la variable aleatoria: nivel de agua de uno de ellos, estará fuertemente influen-
ciada por el bombeo de los otros pozos que constituyen la batería.
Ejemplo de dependencia temporal: para una determinada estación de aforos en un curso de
agua, una tormenta intensa y de larga duración genera una importante avenida, inmediatamente
después del paso del pico de la crecida se produce otra tormenta, y aunque esta sea de menor
intensidad que la anterior, genera otra crecida cuyo pico alcanza niveles muy importantes; con-
siderando la variable aleatoria caudal máximo o nivel máximo alcanzado por el agua, el valor
correspondiente a la segunda crecida depende del caudal o nivel de agua que tenía río al momento
de iniciarse, por lo tanto hay una dependencia directa con el primer evento.
Ejemplo de falta de homogeneidad: Para una cuenca determinada, la población de caudales que
escurren por una sección del cauce principal pierde homogeneidad si en algún momento se pro-
duce, tanto en forma gradual como rápida, el desmonte de una superficie importante del área
de aporte; como consecuencia del desmonte se incrementa la escorrentía superficial y disminuye
la infiltración resultando que las crecidas tengan picos más importantes y en el estiaje el caudal
disminuya considerablemente.
La muestra de datos debe ser tal que, los estadísticos que se calculan a partir de esta: media
(Xm), desvío(S), varianza (S2), asimetría (Cs), etc., sean considerado estimadores de los paráme-
tros equivalentes de la población: media (μ), desvío(), varianza(2), asimetría(γ), etc., de esta
forma:
μ Xm aS γ a Cs
0,5
Si N < 30 a =[N/(N-1)] Si N < 30 a = N /[(N-1) (N-2)]
Si N > 30 a = 1 Si N > 30 a = 1
La población que reúne la v.a.h. tiene una determinada distribución de probabilidades, la que
debe ser estimada a partir de los datos de la muestra y sus respectivos estadísticos.
En hidrología se utilizan un gran número de funciones teóricas de distribución de probabilida-
des y los parámetros de estas funciones deben ser estimados a partir de los estadísticos de la
muestra.
Existen diversos métodos de estimación de parámetros de las funciones de probabilidades
dentro de los que se destacan: Método de los Momentos, Método de la Máxima Verosimilitud, Mé-
todo de los Momentos Pesados o Ponderados, Método de los Momentos Combinados o Mixtos y
Método de los Mínimos Cuadrados. En análisis de estos métodos escapa al alcance propuesto, se
recomienda, para su estudio recurrir a: "Probability and Statistics in Hydrology" Yevjevich, V. Water
Resourses Publications. Fort Collins. Colorado. USA (1972) y “Elementos de la Teoría de Probabi-
lidades”. CRAMER, H. Aguilar. España. (1970)
Se la incluye por ser muy conocida y porque se la utiliza para estudiar y comparar su compor-
tamiento con otras distribuciones.
Las funciones de densidad y de distribución de la variable (Figura No. 4.6), comúnmente re-
ferida como N(,), tienen la siguiente forma:
1 ‐(x-μ)2 x
f x = e 2 σ2 - < x < F x = f x dx
σ √2π -
En este caso se asume que tanto la media (μ) como el desvío poblacional () son iguales a
sus correspondientes (Xm y S) de la muestra de datos, y como se trata de una integral sin solución
analítica se debe resolver con las tablas desarrolladas a tal efecto.
Estas tablas están construidas para una función N(0,1), donde μ = 0 y = 1; para trabajar
con una N(μ, ),se debe hacer un cambio de variables: u = ( x - μ ) /.
Para determinar la probabilidad de ocurrencia de un determinado evento xo, se calcula el valor
de u haciendo x = xo y con ese valor de u se ingresa a la tabla adjunta, que directamente da el
valor de la probabilidad buscada.
Para el proceso inverso: ¿cuál es el valor de xo que tiene una probabilidad de ocurrencia
determinada?, se ingresa a la tabla por el lado de las probabilidades y se obtiene un valor de u, el
xo calcula como xo = + u
siguientes ecuaciones:
2
2 σ 0,5
β= α= 0,5
Xo= μ- σ β
γ β
Recurrencia en años
2 5 10 25 50 100 200
Estimador de la Asimetría Probabilidad de ser superado P(X>=xo) = 1-F
Poblacional 0.50 0.20 0.10 0.04 0.02 0.01 0.005
-1.4 0.225 0.832 1.041 1.198 1.270 1.318 1.351
-1.6 0.254 0.817 0.994 1.116 1.166 1.197 1.216
-1.8 0.282 0.799 0.945 1.035 1.069 1.087 1.097
-2 0.307 0.777 0.895 0.959 0.980 0.990 0.995
-2.5 0.360 0.711 0.711 0.793 0.798 0.799 0.800
-3 0.396 0.636 0.660 0.666 0.666 0.667 0.667
donde el factor de frecuencia K se obtiene de la tabla utilizada para la distribución Pearson III.
Distribución de Goodrich:
La función de distribución de probabilidades, ajustable con tres parámetros, tiene la siguiente
forma:
1/n
F x = 1- e- a x -Xo
donde: a, Xo y n son los parámetros de la distribución, a: constante de ajuste de la media; xo: valor
mínimo permanente de la variable y n: coeficiente de irregularidad.
Los parámetros de la función dependen de la media, desvío y asimetría poblacional que pue-
den ser estimados por sus correspondientes de la muestra: Xm, S y Cs.
El valor de n se obtiene en función de la asimetría tal como se muestra en la siguiente tabla,
cuando Cs > 2 no se recomienda el ajuste con esta función de distribución.
Cs 0,069 0,217 0,359 0,496 0,631 0,764 0,895 1,028 1,160 1,294 1,430 1,567 1,708 1,852 2,0
n 0,30 0,35 0,40 0,45 0,50 0,55 0,60 0,65 0,70 0,75 0,80 0,85 0,90 0,95 1,0
0,5
1 S2 1
= Xo = Xm- (n+1)
an 2n+1 - 2 (n+1) an
donde ( ): es la función Gamma o factorial.
Función de Distribución de Valores extremos Tipo II. Función de Frechet (Log Gumbel):
Dada una variable aleatoria x, si y = ln x tiene una distribución de Gumbel, se dice que los
valores de x tienen una distribución Log Gumbel o Frechet, resultando una función de distribución
doble exponencial de dos parámetros idéntica a la de Gumbel:
(y - XLo)
-
-e αL
F y =e
Los parámetros de la función de distribución se calculan igual a los de la función de Gumbel,
cambiando la media y desvío de la muestra por la media y desvío de los logaritmos de los valores
de la muestra.
Xt
Por lo tanto se puede definir como período de retorno T al intervalo de recurrencia promedio
entre eventos que igualan o exceden una magnitud determinada; es indispensable, para expresar
T en años, que la muestra esté conformada por un valor por cada año o ciclo hidrológico.
Asociando a T con la probabilidad de ocurrencia de un determinado evento, se tiene:
la recurrencia de que un determinado evento xo sea superado es T = 1 / [1 - F(xo)]
la recurrencia de que ocurran eventos menores a xo T = 1 / F(xo)
estadística puesto que se asigna al valor menor (i = 1) una frecuencia experimental F* = 0%,
esto tampoco es real puesto que establece que no se pueden producir eventos menores al
mínimo; no existe un suceso nulo.
i
F xi = (Weibull) expresión muy utilizada con funciones de baja asimetría, típica de
N+1
series de valores medios con escasa fluctuación de la variable alrededor de la media (preci-
pitación anual, mensual, temperatura media anual, caudales medios anuales, etc.)
i - 0,5
F xi = (Hazen) recomendada para series de valores extremos como la máxima
N
precipitación diaria, caudales máximos instantáneos, caudales mínimos medios diarios,
etc.).
i- 0,44
F xi = (Grigorten) recomendada para series de valores extremos, distribuciones
N – 0,12
del tipo I.
0
X
Frec. Experimental Frec. Teórica
6. Seleccionar las funciones de distribución de probabilidades en función de los estadísticos de la
muestra, calcular sus parámetros según corresponda.
7. Cálculo de las probabilidades (F(x)) para un gran recorrido de la v.a., incluyendo los valores
de la serie y también se debe calcular los valores de la v.a. para las distintas F*, de esta manera
se conforma un importante conjunto de pares x – F(x) para graficar sobre los puntos x – F*
(Figura No. 4.9). Este paso se realiza para todas las funciones seleccionadas en el punto 6.
8. Seleccionar la función teórica que mejor se ajusta a la muestra, para esta tarea se recurre
a una serie de métodos que deben ser evaluados en forma conjunta para tomar una decisión:
a).- Contraste Visual entre los puntos de x – F* y las distintas funciones de distribución eva-
luadas.
b).- Tests Estadísticos, se plantea una hipótesis de aceptar el ajuste estadístico con un de-
terminado nivel de significación , en hidrología se utiliza = 0.05 = 5%, esto quiere decir
que se tiene un 95% de probabilidad de haber tomado una decisión correcta (haber aceptado
el ajuste siendo bueno o rechazarlo siendo malo). No es conveniente tomar un menor
puesto que aumenta la probabilidad de aceptar la hipótesis siendo incorrecta o falsa.
Los tests más usados son el 2 de Pearson y el de Smirnov-Kolmogorov.
2 de Pearson: Divide el rango de la variable en intervalos de clases haciendo una comparación
entre el número total de observaciones en cada intervalo y el número esperado.
Llamando:
r Oi-NPi
2c = Zi2 con Zi=
1 NPi0,5
Donde: i = 1 ... r (número de intervalos)
Oi, número de observaciones en el intervalo i
NPi, número de valores esperados en el intervalo i según la función teórica, N es el
número total de datos de la serie y Pi es el intervalo de probabilidad correspondiente
al intervalo de clase i.
Para aceptar el ajuste se debe verificar:
2c = 2α,
Donde: 2, es el valor teórico tabulado para un nivel de significación y grados de libertad, = r
– k – 1; siendo k el número de parámetros de la función de distribución de probabilidades (en la
Normal k = 2 (,); en PIII k = 3 (,xo,); etc.).
∑N
1 F xi - F*i
2
AMCF=
N
∑N
1 xi-x(Fi)
2
AMCV=
N
1000
800
Xm + S
600
Xm
400
Xm ‐ S
200
0
1935 1940 1945 1950 1955 1960 1965 1970 1975 1980 1985 1990
Tiempo (años)
Esta forma de representación constituye un primer paso que permite apreciar la variación en
el tiempo del conjunto de la información.
Figura No. 4.11 Evaporación Media Mensual (20 años). Tanque A. Embarcación
160
Los diagramas de barras 140
permiten sintetizar la informa-
120
ción, generalmente a partir de
Evaporación (mm)
0
ENE FEB MAR ABR MAY JUN JUL AGO SEP OCT NOV DIC
20.0
una variable (Figuran No. 4.12):
15.0
10.0
5.0
0.0
ENE FEB MAR ABR MAY JUN JUL AGO SEP OCT NOV DIC
Int. de Clase Frec. Abs. Frec. Rel. Frec. Abs. Frec. Rel.
(unidad v.a.) % Acumulada Acumulada %
0 0
(xo - x1) fa1 fr1 = fa1/N Fa1 = fa1 Fr1 = fr1
(x1+0,0001 – x2) fa2 fr2 = fa2/N Fa2 = fa1 + fa2 Fr2 = fr1 + fr2
…. …. …. …. ….
fai = N fi = 1
Intervalos de Clases: son intervalos de la variable de menor amplitud que el rango de
variación de la misma, es conveniente que estos intervalos tengan una misma amplitud. El
número de intervalos depende de la longitud de la serie y de cómo se distribuyen los valores
en todo el rango.
No hay una expresión matemática con fundamentos teóricos para calcular la amplitud; la
siguiente relación empírica se puede utilizar como un punto de partida, y luego tantear su-
cesivamente hasta lograr un número de intervalos en el cual la distribución de la masa sea
compacta y sin cortes intermedios:
Rango Rango
+
Rango = Máx. valor v.a. - Mín. valor v.a. Amplitud = 5 20
2
Cuando se trabaja con series con grandes variaciones entre el mínimo y el máximo, con una
fuerte concentración de valores en los primeros intervalos y muy dispersos y escasos en el
extremo de los máximos, esto hace conveniente trabajar con dos o más amplitudes de inter-
valos.
El punto medio de cada intervalo de clase se denomina marca de clase.
Frecuencia Absoluta: es el número de valores (fai), del total de la muestra, que caen
dentro de cada intervalo de clase; la sumatoria de los valores de esta columna es igual al
número total de datos N.
Frecuencia Relativa: es el cociente entre la frecuencia absoluta de cada intervalo de
clase y el número total de observaciones de la serie, fi = fai/N; es evidente que la sumatoria
de los fi de esta columna es igual a la unidad.
Frecuencia Absoluta Acumulada: se construye a partir de la suma de las frecuencias
Ing. Rec. Hídricos Juan B. Sciortino 61
ELEMENTOS DE HIDROLOGÍA CAPÍTULO 4
CÁTEDRA: HIDRÁULICA APLICADA
absolutas que se acumulan, desde el primer intervalo (menor), hasta el último en considera-
ción y representa, en el caso de la curva creciente, la cantidad de observaciones menores
al extremo superior de cada intervalo.
j
Faj= fai i=1, 2, …, j
i=1
Es costumbre, en el caso de procesar una serie de caudales pertenecientes a una determinada
estación de medición, trabajar con la frecuencia acumulada decreciente, asignando al extremo
inferior del primer intervalo el número N y restando, en cada fila, la frecuencia absoluta de cada
intervalo, de esta manera se obtiene la cantidad de valores que hay por encima del extremo
superior de cada intervalo.
j
Faj= N - fai i=1, 2, …, j
i=1
Frecuencia Relativa Acumulada: se realiza el mismo análisis que en la columna pero
con los valores de la frecuencia relativa; en el caso de la curva creciente, cada celda repre-
senta, el porcentaje de observaciones menores al extremo superior del intervalo correspon-
diente, con respecto al total de la serie de datos.
Ejemplo:
Muestra de datos: 14 años de temperaturas medias mensuales en San Rafael (Mendoza)
Total datos N = 168 Máximo = 25,1ºC Mínimo = 3,8ºC Rango = 21,3ºC
Amplitud calculada: 2,66ºC Amplitud adoptada: 2,0ºC
Frec. Rel. Frec. Rel.
Intervalos de Frec. Abs. Frec. Abs.
Frecuencia Frec. Relativa Acumulada Acumulada
Clase Acumulada Acumulada
Absoluta (%) Creciente Decreciente
(ºC) Creciente Decreciente
(%) (%)
0 0 168 100
3.00 - 5.00 2 1.19 2 1.19 166 98.81
5.01 - 7.00 10 5.95 12 7.14 156 92.86
7.01 - 9.00 21 12.50 33 19.64 135 80.36
9.01 - 11.00 25 14.88 58 34.52 110 65.48
11.01 - 13.00 11 6.55 69 41.07 99 58.93
13.01 - 15.00 18 10.71 87 51.79 81 48.21
15.01 - 17.00 12 7.14 99 58.93 69 41.07
17.01 - 19.00 14 8.33 113 67.26 55 32.74
19.01 - 21.00 27 16.07 140 83.33 28 16.67
21.01 - 23.00 18 10.71 158 94.05 10 5.95
23.01 - 25.00 9 5.36 167 99.40 1 0.60
25.01 - 27.00 1 0.60 168 100.00 0 0.00
Se recomienda, para visualizar la importancia de la clasificación, realizar el ejemplo pero con un
intervalo de clase de 2,5ºC.
que resulta equivalente al histograma y se obtiene uniendo mediante segmentos los centros de las
bases superiores de los rectángulos del histograma, es decir, en abscisas: los puntos de las marcas
de clase y en ordenadas la frecuencia correspondiente, absoluta o relativa.
El histograma de frecuencias acumuladas (absolutas o relativas) se construye con los va-
lores acumulados de frecuencias en cada intervalo de clase.
Los polígonos de frecuencias acumuladas u ojivas resultan de unir los centros de las bases
superiores de los rectángulos de la distribución del histograma de frecuencias acumuladas.
En ambos casos pueden construirse en forma creciente o decreciente; los histogramas acu-
mulados y ojivas crecientes son las representaciones más comunes en las diversas ciencias que
recurren a la estadística, inclusive, en la hidrología, pero los decrecientes son, a fuerza de costum-
bre, utilizados para representar la distribución de frecuencias de caudales.
Ejemplo: De la tabla del ejercicio anterior se obtienen las siguientes figuras: Histograma de Fre-
cuencias Absolutas (Fig. No. 4.13), Histograma de Frecuencias Relativas (Fig. No. 4.14), Histo-
grama de Frecuencias Relativas Acumuladas Creciente (Fig. No. 4.15), Polígono de frecuencias
relativas (Fig. No. 4.16) y Polígonos de frecuencias acumuladas relativas (Fig. No. 4.17).
30
25
20
15
10
0
3 5 7 9 11 13 15 17 19 21 23 25 27 29
1 3 5 7 9 11 13 15 17 19 21 23 25 27
ºC
18
16
Se puede observar
14
que no existe dife-
rencia en la forma 12
relativa de los histo- 10
gramas.
8
6
4
2
0
3 5 7 9 11 13 15 17 19 21 23 25 27 29
1 3 5 7 9 11 13 15 17 19 21 23 25 27
ºC
100
90
80
70
60
50
40
30
20
10
0
3 5 7 9 11 13 15 17 19 21 23 25 27
1 3 5 7 9 11 13 15 17 19 21 23 25
ºC
Mediana Media
16
14
12
10
8
6
4
2
0
1 3 5 7 9 11 13 15 17 19 21 23 25 27 29
ºC
90
80
70
60
50
40
30
20 Mediana
10
0
1 3 5 7 9 11 13 15 17 19 21 23 25 ºC 27
Con la tabla de frecuencia y los gráficos resultantes se pueden precisar dos conceptos ya
definidos en el apartado 4.2.4 “medidas de tendencia central”:
Mediana: es la medida de la variable que divide la masa de las frecuencias relativas en dos partes iguales o,
lo que es lo mismo, es el valor de la variable en el cual el 50% del tiempo se han producido valores menores
o iguales.
Moda: es el valor que ocurre con mayor frecuencia en una tabla o curva de frecuencias de una serie de datos.
Es posible que en algunas ocasiones se presente dos intervalos con la mayor frecuencia, lo cual se denomina
Bimodal, en otros casos, más de dos valores, lo que se conoce como multimodal.
Cuando una distribución es simétrica, la media coincide con la mediana y con la moda y la
asimetría de la muestra es igual a 0.
En la Figura No. 4.18 se muestra la relación entre las medidas de tendencia central y distribu-
ciones de frecuencias.
Moda
Moda
Moda
Mediana
Mediana
Media
Media
Media
Una forma de cuantificar la serie de datos está dada por las denominadas medidas de posición,
dentro de estas se destacan:
Percentiles: son los valores de la variable resultantes de dividir la curva de frecuencias relativas
creciente en cien partes porcentualmente iguales; el Percentil 15 (P15) es el valor de la variable en
la cual el 15% de los datos observados son menores.
Cuartiles: son los tres valores la variable que dividen la curva de frecuencias relativas creciente en
cuatro partes porcentualmente iguales, constituyen un caso particular de percentiles; el primer cuar-
til Q1 es P25, es el valor de la variable que supera una cuarta parte de los valores de la serie; el
segundo cuartil Q2 es P50, coincide con la mediana, corresponde al valor que supera el 50% de los
datos y el tercer cuartil Q3 es P75 corresponde al valor que es mayor que tres cuartas partes de los
datos.
Analizando las figuras precedentes y la tabla de frecuencia del ejemplo anterior se puede realizar
el siguiente resumen de las características de la serie de datos:
Total datos N = 168 Máximo = 25,1ºC Mínimo = 3,8ºC Rango = 21,3ºC
Media = 14,8 ºC Mediana = 13,7 ºC
Moda = Bimodal (dos modas extremas bien definidas 10 y 20 ºC respectivamente con mayor con-
centración en la temperatura más baja)
Varianza = 32 Desvío Estándar = 5,7 ºC Coef. Variación = 38,2 %
Coeficiente de Asimetría = -0,023 Curtosis = -3,41
Cuartiles: Q1 = 8,7 ºC Q2 = 13,7 ºC Q3 = 19,0 ºC
Percentiles: P10 = 6,5 ºC P40 = 11,7 ºC P60 = 16,3 ºC P90 = 21,2 ºC
Obsérvese que, en ningún momento, en el estudio descriptivo de los datos de una serie (tabla
de frecuencia, histogramas y polígonos de frecuencia) se ha utilizado término “probabilidad”, siem-
pre se ha hecho referencia al porcentaje de datos, con respecto a la totalidad de la serie o conjunto
de observaciones existentes de la variable, que son superados por un valor determinado de la va-
riable o que superan dicho valor. Esto se debe a que se estudia y describe un conjunto de valores
y no se infiere acerca de la población que los contiene.
Para determinar la probabilidad de ocurrencia de un determinado valor de una variable se
requiere, realizar la inferencia estadística de la población a la cual pertenece la muestra de datos y
evaluar el modelo probabilístico correspondiente.
Se realiza esta diferenciación, pese a que es obvia, puesto que es muy común escuchar a
profesionales que, desconociendo los conceptos básicos de la estadística, hacen referencia, a partir
de un simple polígono de frecuencias acumuladas resultante de un conjunto de observaciones de
una variable, a la probabilidad de ocurrencia de un determinado valor, cuando en realidad se tiene
que decir que, del conjunto de observaciones, el valor de referencia ha sido superado un porcentaje
determinado de veces o de tiempo, o que, este valor es mayor a un tanto por ciento del total de
datos.
X
La ecuación de la función Y* = f(X), debe ser tal, que sea mínima la distancia entre los valores
observados Yi y los correspondientes de la función Y*i, para lo cual se utiliza el método denominado
Mínimos Cuadrados.
X
Derivando queda un sistema de dos ecuaciones con dos incógnitas donde “a” y “b” se obtienen
de las siguientes expresiones:
∑N N N
1 Xi ∑1 Yi – N ∑1 Xi Yi SXY
a= 2
= 2
∑N N 2 SX
1 Xi - N ∑1 Xi
b= Ym – a Xm
siendo: Xm, Ym las valores medios de las series X e Y respectivamente
SX , Sy el desvío estándar de la series X e Y respectivamente (SX2 varianza)
SXY covarianza de las series X, Y
La covarianza es una medida de la asociación lineal entre dos variables aleatorias que resume
la información existente en un gráfico de dispersión, en general se simboliza como SXY cuando se
trata de dos series o muestras y XY.
Una covarianza positiva significa que existe una relación lineal positiva entre las dos variables.
Es decir, los valores bajos de la variable (X) se asocian con los bajos de la variable (Y), mientras
los altos de X se asocian con los valores altos de Y.
Una covarianza de negativa significa que existe una relación lineal inversa perfecta (negativa)
entre las dos variables. Lo que significa que los valores bajos en X se asocian con los valores altos
en Y, mientras los altos en X se asocian con los bajos en Y.
La covarianza se aproxima a cero cuando no exista relación entre ambas variables o cuando,
existiendo, la relación sea marcadamente no lineal.
La covarianza depende de las unidades de medida de las variables, por lo que no es útil al
momento de comparar grupos diferentes de observaciones con unidades o escalas de medición
diferentes.
A fin de solucionar el problema de unidades y definir el grado de relación entre las variables
Pearson desarrolló el denominado Coeficiente de Correlación (R), que resulta del cociente entre la
covarianza y el producto de los desvíos de ambas variables:
R0
Figura No. 4.21
SXY R -1
R= Variables no correlacionadas
Correlación negativa
2 2
SX SY
donde -1 ≤ R ≤ 1
Si R = 0, no existe correlación, por
lo tanto hay independencia total en-
tre las dos variables.
Si R = 1, existe una correlación po-
sitiva perfecta o dependencia total
entre las dos variables, todos los
puntos se alinean en la recta. R 0 R 1
Si 0 < R < 1, correlación positiva. Correlación no lineal Correlación positiva
Cuando el diagrama de dispersión muestra que los puntos siguen una relación que no es lineal,
pero sí: exponencial, logarítmica, parabólica (polinómica), hiperbólica, etc., es evidente que el coe-
ficiente de correlación lineal no sirve para medir la calidad de la relación entre variables, en estos
casos se utiliza otro tipo de coeficiente.
Las regresiones no lineales pueden ser presentadas de la siguiente forma:
Exponencial: Y* = a e b X
Logarítmica: Y* = a + b Ln X
Potencial: Y* = a + Xb
b a
Hiperbólica: Y* =a+ o Y* =
X b+cX
2
Polinómica: Y* =a + b X + c x + …
Para determinar los coeficientes de cualquiera de estas funciones, por el método de mínimos
cuadrados, se procede igual que con la función lineal:
N
2
A= Yi-Y*i
1
se deriva e iguala a 0 la función A, tantas veces como coeficientes se necesiten calcular:
A A A
=0 =0 =0 ……
a b c