Laboratorio RStudio
Laboratorio RStudio
CON P YTHON Y R
R EALIZADO POR :
2. Estadística Descriptiva 13
2.1. Descripción . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13
2.1.1. Tipos de variables . . . . . . . . . . . . . . . . . . . . . . . . . . 13
2.1.2. Datos y clasificación . . . . . . . . . . . . . . . . . . . . . . . . 15
2.2. Medidas de tendencia central . . . . . . . . . . . . . . . . . . . . . . . 17
2.2.1. Media o promedio . . . . . . . . . . . . . . . . . . . . . . . . . 17
2.2.2. Mediana . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
2.2.3. Moda . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
2.3. Medidas de posición . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
2.3.1. Cuartiles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
2.3.2. Percentiles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
2.4. Medidas de dispersión . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
2.4.1. Rango . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
2.4.2. Desviación estandar . . . . . . . . . . . . . . . . . . . . . . . . 21
2.4.3. Varianza . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
2.4.4. Coeficiente de variación . . . . . . . . . . . . . . . . . . . . . . 22
2.4.5. Error estándar . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
2.5. Tablas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
2.5.1. Frecuencia absoluta . . . . . . . . . . . . . . . . . . . . . . . . 22
2.5.2. Frecuencia relativa . . . . . . . . . . . . . . . . . . . . . . . . . 23
2.5.3. Frecuencia absoluta acumulada . . . . . . . . . . . . . . . . . 23
2.5.4. Frecuencia relativa acumulada . . . . . . . . . . . . . . . . . . 24
2.6. Gráficas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.6.1. Barras . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.6.2. Barras apiladas . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
2.6.3. Pie . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
2.6.4. Boxplot . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
1
2.6.5. Histograma . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
2.6.6. Pareto . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
3. Probabilidad 31
3.1. Probabilidad condicionada . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.2. Bayes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33
3.2.1. Teorema de Bayes . . . . . . . . . . . . . . . . . . . . . . . . . . 33
3.3. Distribución binomial . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
3.4. Distribución de Poisson . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
3.5. Distribución Z normal . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
3.6. Intervalos de confianza . . . . . . . . . . . . . . . . . . . . . . . . . . . 36
3.6.1. Pruebas de hipótesis . . . . . . . . . . . . . . . . . . . . . . . . 36
3.6.2. Prueba de normalidad . . . . . . . . . . . . . . . . . . . . . . . 36
3.7. Prueba de varianza . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
3.8. Prueba de media . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
Este documento fue creado para el beneficio de todos los estudiantes que desean utilizar R
y Python para entender algunos conceptos de probabilidad y estadística.
2
Breve introducción a R y
1 Python
SECTION
En esta sección vamos a preparar el entorno con el que se van a ejecutar todos los ejemplos pre-
sentados en este libro, por lo que si ya tiene alguna instalación de R y Python sólo resta verificar
la versión, a fecha de este documento las versiones estables que utilizaremos son:
R 3.5.3
R-studio 1.2.5019
Python 3.8.
en este manual no vamos a profundizar en el lenguaje, por lo que una versión compatible con
python 3 es suficiente para los ejemplos que vamos a ver aquí.
Si se quiere llevar a cabo una instalación completa junto con R, R-studio es la mejor op-
ción, para descargarlo ir a [Link] allí se encuentra el link que redirige a
3
la versión Free. Usualmente ocurre que se debe elegir la versión de R que se va instalar de-
pendiendo del sistema operativo, en este manual, sin embargo si lleva tiempo utilizando
cualquier sistema operativo encontrará bastante sencilla su instalación.
Nota: La única versión que no se recomienda descargar en cualquier caso es la descarga del
código fuente, si la descarga deberá compilar el código desde cero (from scratch), es mucho más
complicado, sólo se recomienda para usuarios avanzados.
4
En los siquientes pasos daremos siguiente, eventualmente llegaremos a
5
Al dar siguiente estamos aceptando los términos de uso de la licencia GNU
6
En los siquientes pasos daremos siguiente, eventualmente llegaremos a
7
Al dar siguiente estamos aceptando los términos de uso de la licencia GNU
8
En los siquientes pasos daremos siguiente, eventualmente llegaremos a
1.4. El lenguaje R
El lenguaje R es un lenguaje y entorno para el desarrollo de aplicaciones estadísticas, compu-
tacionales y gráficas.
9
R ofrece un amplio conjunto de herramientas estadísticas (para modelamiento, pruebas de
hipótesis), herramientas gráficas y es altamente extensible, actualmente es uno de los proyec-
tos de software libre más grandes del mundo, lo cual es una de sus fortalezas ya que al ser un
proyecto de código abierto (en el que cualquiera puede aportar) toda la comunidad que utilza
el software se beneficia de las contribuciones de todos, haciendo que R sea una herramienta en
crecimiento y de uso extendido.
1.4.1. El entorno
Cuando decimos que R también es un entorno, es debido a que no sólamente tiene las funciones
que normalmente encontramos en un lenguaje de programación sino que también tiene un
amplio abanico en crecimiento de ’paquetes’1 para manipulación de texto, carga de archivos
que a su vez pueden ser extendidas. R ha sido escrito deuna manera muy similar a los lenguajes
de programación interpretados con el rendimiento del lenguaje de programación C.
1.4.2. Sintáxis
Como todo lenguaje debemos comprender algunas reglas básicas, a éstas reglas las conocemos
como la sintáxis del lenguaje, dentro de esto encontramos varias categorías:
Estructuras de repetición. Aquí se encuentran las estructuras que nos permiten iterar,
por ejemplo recorrer un archivo.
Funciones. Son piezas de código, que nos ayudan a organizar el código. En general son
una muy buena práctica de programación.
numérico. 2, 3, 3.14
entero. 28L, 3L. el caracter L le indica a R que almacene el dato como un entero.
1
Que son componentes adicionales que se pueden instalar según sea necesario.
10
lógico. TRUE, FALSE.
complejo. 3+14i. En este manual no utilizaremos este tipo de datos para los problemas
que manejamos es suficiente con los reales.
Ejemplo:
x <- "Hola"
x
Salida:
[1] "Hola"
De esta forma acabamos de declarar una variable en R. Nótese que no fue necesario llevar a cabo
una declaración del tipo de variable, R se encarga de asignar el tipo de dato dependiendo de lo
que recibe. Por ejemplo:
x <- 1
x
Salida:
[1] 1
Adicionalmente R también se encuentra provisto de funciones que nos permiten identificar pro-
piedades de los objetos que declaramos:
Ejemplo:
x <- 1L
class(x)
typeof(x)
length(x)
attributes(x)
Salida:
class(x)
[1] "integer"
typeof(x)
[1] "integer"
length(x)
[1] 1
attributes(x)
[1] NULL
11
Cuando declaramos el tipo de dato sabíamos que era un entero, es por ello que obtenemos como
tipo de dato y clase integer, como solo hemos ocupado 1 byte para almacenar el valor ’1’ ob-
tenemos como valor de la función 1. Finalmente, x es un valor escalar, es por ello que no posee
atributos y obtenemos el valor NULL, que indica que no tiene ningún atributo.
R cuenta con estructuras de datos para contener colecciones, nombraremos algunas de ellas:
vectores atómicos.
listas.
matrices.
data frame.
factores.
En aplicaciones estadísticas encontraremos que es muy frecuente el uso de este tipo de estruc-
turas. Los vectores se pueden declarar con varias funciones, las más comunes son vector,
logical, character, integer, numeric.
Ejemplo:
vector()
vector("character", length = 5)
Salida
vector()
[1] logical(0)
vector("character", length = 5)
[1] "" "" "" "" ""
Matrices las matrices son una extensión de los vectores pero tienen varias mas de una di-
mensión. Ejemplo:
Salida:
[,1] [,2]
[1,] NA NA
[2,] NA NA
12
2
Listas Las listas en R actúan como contenedores. A diferencia de los vectores atómicos las
listas puden contener diferentes tipos de datos, por ejemplo:
salida:
[[1]]
[1] 1
[[2]]
[1] "hola"
[[3]] SECTION
[1] TRUE
[[4]] Estadística Descriptiva
[1] 3 + 14i
2.1. Descripción
La estadística descriptiva es la estadística que recolecta, presenta y caracteriza un conjunto de
datos (por ejemplo, la edad de una población, la altura de los estudiantes de una escuela, tem-
peratura en los meses de verano, etc.) con el fin de describir apropiadamente las diversas carac-
terísticas de ese conjunto. Al conjunto de los distintos valores numéricos que adopta un carácter
cuantitativo se llama variable estadística. Y existen de diferentes tipos.
Las variables se clasifican de diversas maneras según el atributo que poseen, en estadística des-
criptiva se clasifican en:
Variables cualitativas o categóricas, estas son las que no se pueden medir numéricamente
(o de manera cuantitativa).
Ejemplos
• Nacionalidad.
• Color de piel.
• Sexo.
Variables cuantitativas, estas tienen un valor numérico. Son valores que podemos cuanti-
ficar y relacionar con un número.
13
También se clasifican por su dimensión:
Ejemplos
Ejemplos
Ejemplo
Para las varaiables cuantitativas existe una segunda categorización, esta se da según el tipo de
número que contienen, estas pueden ser discretas o continuas.
Las variables discretas son aquellas que sólo pueden tomar valores enteros (1, 2, −4, et c.)
Ejemplo
• Número de hermanos, solo pueden ser 1, 2, 3...et c nunca podrá ser 3, 45.
Las variables continuas son aquellas que pueden tomar cualquier valor real dentro de un
intervalo.
Ejemplo
Cada variable tiene un comportamiento diferente y un tratamiento diferente, por lo que de-
bemos aprender a reconocer algunas definiciones
Individuo Cualquier elemento que porte información sobre el fenómeno que se estudia. Así,
si estudiamos la altura de los niños de una clase, cada alumno es un individuo; si se estudia el
precio de la vivienda, cada vivienda es un individuo.
Población: Es el conjunto de todos los individuos (personas, objetos, animales, etc.) que por-
ten información sobre el fenómeno que se estudia. Por ejemplo, si se estudia el precio de la vi-
vienda en una ciudad, la población será el total de las viviendas de dicha ciudad.
14
Muestra Es un subconjunto que seleccionado de una población. Por ejemplo, si se estudia el
precio de la vivienda de una ciudad, lo normal será no recoger información sobre todas las vi-
viendas de la ciudad (sería una labor muy compleja), sino que se suele seleccionar un subgrupo
(muestra) que se entienda que es suficientemente representativo.
Los datos pueden concebirse como información necesaria para ayudar a tomar una decisión
con mayores fundamentos en una situación particular. Los datos son medidas y/o números re-
copilados a partir de la observación o instrumentos (como encuestas). Existen varios métodos
con los cuales se pueden obtener datos necesarios, se pueden buscar datos ya publicados por
otras fuentes o publicaciones científicas.
Acerca de esta imágen Para lograr la construcción de esta imágen se requirieron procesar
mas de 5 Petabytes entre diversos observatorios. Ningún canal de comunicación sería eficiente
para transportar esta cantidad de información, debido a ello se decidió enviar los discos duros en
donde estaba almacenada la información recopilada, es un ejemplo muy claro de utilizar técnicas
de recopilación de datos junto con modelos para construir y predecir una imágen de como se ve el
agujero negro.
También, se pueden diseñar experimentos y conducir estudios para recopilar los datos. En
algunos casos se pueden hacer observaciones del comportamiento, actitudes y opiniones de los
individuos en los que se está interesado en estudiar, en otros casos se utilizan modelos matemá-
ticos para construir un conjunto de datos.
Medir en el campo de las ciencias exactas es comparar una magnitud con otra, tomada de
manera una manera no arbitraria como referencia. En el campo de las ciencias sociales medir es
15
“el proceso de vincular conceptos abstractos con indicadores empíricos”. Al resultado de medir
se le llama medida.
La medición de las variables puede realizarse por medio de cuatro escalas de medición: la no-
minal, ordinal, de intervalo y de razón. Se utilizan para ayudar en la clasificación de las variables,
el diseño de las preguntas para medir variables, e incluso indican el tipo de análisis estadístico
apropiado para el tratamiento de los datos, las mediciones y los datos son la escencia de la esta-
dística y del análisis estadístico.
Medición Nominal: O por categorías. En este nivel de medición se establecen las catego-
rias distintivas que no implican un orden específico. Por ejemplo, si la unidad de análisis
es un grupo de personas, para clasificarlas se puede establecer la categoría sexo con dos
niveles, masculino (M) y femenino (F), los encuestados sólo tienen que señalar su género,
no se requiere de un orden real. Así, se pueden asignar números a estas categorías para
su identificación: 1 = M , 2 = F o bien, se pueden invertir los números sin que afecte la
medición: 1 = F y 2 = M . En resumen, en la escala nominal se asignan números a eventos
con el propósito de identificarlos.
Medición Ordinal: O por orden. Se establecen categorías con dos o más niveles que im-
plican un orden inherente entre si. La escala de medición ordinal es cuantitativa porque
permite ordenar a los eventos en función de la mayor o menor debido a la posesión de
un atributo o característica. Por ejemplo, en las instituciones escolares de nivel básico
suelen formar por estatura a los estudiantes, se desarrolla un orden cuantitativo pero no
suministra medidas de los sujetos. Estas escalas admiten la asignación de números en
función de un orden prescrito. Las formas más comunes de variables ordinales son ítems
(reactivos2 ) actitudinales estableciendo una serie de niveles que expresan una actitud de
acuerdo o desacuerdo con respecto a algún referente. Por ejemplo, ante el reactivo: Pemex
debe privatizarse, el respondiente puede marcar su respuesta de acuerdo a las siguientes
alternativas:
• Totalmente de acuerdo.
• De acuerdo.
• Indiferente.
2
La posición de una persona frente a algo
16
• En desacuerdo.
• Totalmente desacuerdo.
Las anteriores alternativas de respuesta pueden codificarse con números que van del uno
al cinco y que sugieren un orden preestablecido pero no implican una distancia entre un
número y otro.
Medición de Razón: Una escala de medición de razón incluye las características de los
tres anteriores niveles de medición (nominal, ordinal e intervalo). Determina la distancia
exacta entre los intervalos de una categoría. Adicionalmente tiene un punto cero absoluto,
es decir, en el punto cero no existe la característica o atributo que se mide. Las variables
de ingreso, edad, número de hijos, etc. son ejemplos de este tipo de escala. El nivel de
medición de razón se aplica tanto a variables continuas como discretas.
l i b r a r y ( readxl )
## L i b r e r i a que l e e l o s archivos
DB <− read_excel ( " baseDeDatos . x l s x " , sheet = "BD CUALI − CUANTI" )
## Ubicacion del archivo y que hoja q u i s i e r a importar
View (DB)
17
caso debemos usar la transpuesta de la matrix para que el codigo funcióne lo cual se hará con el
siguiente codigo:
mean( dc )
También se puede obtener la media recortada, la cual recorta una proporción de observaciones
por ambos lados de la distribución.
mean( dc , trim = 0 . 2 )
2.2.2. Mediana
Otra medida de tendencia central es la mediana. La mediana es el valor de la variable que ocupa
la posición central, cuando los datos se disponen en orden de magnitud. Es decir, el 50 % de las
observaciones tiene valores iguales o inferiores a la mediana y el otro 50 % tiene valores iguales
o superiores a la mediana. Ejemplo Encontraremos la mediana de una de las filas de los datos,
obtaremos por hijos en este caso debemos usar la transpuesta de la matrix para que el codigo
funcióne lo cual se hará con el siguiente código:
median ( dc )
18
2.2.3. Moda
La moda de una distribución se define como el valor de la variable que mayorfrecuencia tie-
ne. En un polígono de frecuencia, la moda corresponde al valor de la variable que está bajo el
punto más alto del gráfico. Una muestra puede tener más de una moda. Ejemplo Encontrare-
mos la moda de una de las filas de los datos, obtaremos por hijos en este caso debemos usar la
transpuesta de la matrix para que el programa se ejecute correctamente:
t a b l e ( dc )
2.3.1. Cuartiles
Los cuartiles son los tres valores que dividen al conjunto de datos ordenados en cuatro partes
porcentualmente iguales. Hay tres cuartiles denotados usualmente Q1, Q2, Q3. El segundo cuar-
til es precisamente la mediana. El primer cuartil, es el valor en el cual o por debajo del cual queda
un cuarto (25 %) de todos los valores de la sucesión (ordenada); el tercer cuartil, es el valor en el
cual o por debajo del cual quedan las tres cuartas partes (75 %) de los [Link] Encontra-
remos los cuartiles de una de las filas de los datos, obtaremos por el número de hijos en este caso
debemos usar la transpuesta de la matrix para que el programa se ejecute correctamente:
quantile ( dc )
19
2.3.2. Percentiles
Los percentiles son, tal vez, las medidas mas utilizadas para propósitos de ubicación o clasifica-
ción de las personas cuando atienden características tales como peso, estatura, etc. Los percen-
tiles son ciertos números que dividen la sucesión de datos ordenados en cien partes porcentual-
mente iguales. Estos son los 99 valores que dividen en cien partes iguales el conjunto de datos
ordenados. Los percentiles (P1, P2,... P99), leídos "primer percentil", ..., "percentil 99". Ejemplo
Encontraremos los percentiles de una de las filas de los datos, obtaremos por hijos en este caso
debemos usar la transpuesta de la matrix para que el programa se ejecute correctamente:
quantile ( dc , 0 . 2 5 )
2.4.1. Rango
El Rango es el intervalo entre el valor máximo y el valor mínimo; por ello, comparte unidades
con los datos. Permite obtener una idea de la dispersión de los datos, cuanto mayor es el rango,
más dispersos están los datos (sin considerar la afectación de los valores extremos). El rango,
también es llamado amplitud o recorrido. Ejemplo Encontraremos el rango de una de las filas
de los datos, obtaremos por el número de hijos, en este caso debemos usar la transpuesta de la
matrix para que el programa funcione correctamente:
range ( dc )
20
En consola aparecerá lo siguiente:
La desviación estándar es la medida de dispersión mas común, indica que tan dispersos estan
los datos con respecto a la media. Mientras mayor sea la desviación estándar, mayor será la
dispersión de los datos. Ejemplo Encontraremos la desviación estandar del número de hijos.
sd ( dc )
2.4.3. Varianza
La varianza mide qué tan dispersos están los datos alrededor de la media. La varianza es igual
a la desviación estándar elevada al cuadrado. Es una medida adicional que se utiliza tambien
para compararse respectoa la media, sin embargo debido a que depende de la desviación, si
la desviación es muy alta, la varianza se incrementará al cuadrado, lo que la convierte en una
medida inconveniente en algunos casos. Ejemplo Encontraremos la varianza del número de
hijos.
var ( df )
21
2.4.4. Coeficiente de variación
Se calcula para cada una de las distribuciones y los valores que se obtienen se comparan entre
sí. La mayor dispersión corresponderá al valor del coeficiente de variación mayor.
2.5. Tablas
Es de utilidad en el análisis estadístico obtener los resultados del análisis en un único lugar, es
por ello que existen las tablas, esta sección será mucho más práctica veremos como obtener en
R algunos de los valores que se requieren con mayor frecuencia.
La frecuencia absoluta es una medida estadística que nos da información acerca de la cantidad
de veces que se repite un suceso al realizar un número determinado de experimentos aleatorios.
Ejemplo Encontraremos la tabla de frecuencia absoluta de una de las filas de los datos, obtare-
mos por el número de hijos.
t a b l e ( dc )
22
2.5.2. Frecuencia relativa
t a b l e ( dc ) / length ( dc )
cumsum( t a b l e ( dc ) )
23
2.5.4. Frecuencia relativa acumulada
cumsum( t a b l e ( dc ) / length ( dc ) )
2.6. Gráficas
Las gráficas y las tablas son las herramientas que nos permiten observar gráficamente la pobla-
ción. Para las gráficas usaremos el paquete ggplot2, si no tenemos el paquete intalado podemos
usar el siguente comando:
2.6.1. Barras
Un diagrama de barras, también conocido como gráfico de barras o gráfico de columnas, es una
forma de representar gráficamente un conjunto de datos o valores, y está conformado por barras
rectangulares de longitudes proporcionales a los valores representados. Los gráficos de barras
son usados para comparar cantidades de valores en diferentes momentos, o también podría de-
cirse productos. Las barras pueden orientarse horizontal o verticalmente. Ejemplo Realizaremos
un diagrama de barras a la variable hijos, genero y estado civil.
24
l i b r a r y ( ggplot2 )
df<− baseDeDatos
Es una gráfica donde se apilan una serie de rectángulos (uno sobre otro), en donde el área de ca-
da rectángulo es proporcional a la cantidad que representa. Este tipo de gráfica puede utilizarse
para comparar fácilmente las partes de un todo. Ejemplo Realizaremos un diagrama de barras
apiladas a las variables hijos, genero y estado civil.
l i b r a r y ( ggplot2 )
df<−baseDeDatos
25
2.6.3. Pie
Un gráfico circular o gráfica circular, también llamado "gráfico de pastel", "gráfico de tarta",
"gráfico de torta.o "gráfica de 360 grados", es un recurso estadístico que se utiliza para repre-
sentar porcentajes y proporciones. El número de elementos comparados dentro de una gráfica
circular suele ser de más de cuatro. Ejemplo Realizaremos un diagrama de pie a la variable Ac-
cidentes.
l i b r a r y ( ggplot2 )
df<− baseDeDatos
Df <− Df %> %
arrange ( desc ( modality ) ) %> %
mutate ( prop = frequency /sum( frequency ) * 100
, lab . ypos = cumsum( prop ) − 0 . 5 * prop )
26
g <− ggplot ( Df , aes ( x = " " , y = prop , f i l l = modality ) ) +
geom_bar ( width = 1 , s t a t = " i d e n t i t y " , color = " white " ) +
coord_polar ( " y " , s t a r t = 0)+
geom_text ( aes ( y = lab . ypos
, l a b e l = paste ( prop , " % " ) ) , color = " white ")+
s c a l e _ f i l l _ m a n u a l ( values = mycols ) +
theme_void ( )
return ( g )
}
pie ( accidentes )
2.6.4. Boxplot
Los diagramas de Caja-Bigotes (boxplots o box and whiskers) son una presentación visual que
describe varias características importantes como la dispersión y la simetría. En ella se represen-
tan los tres cuartiles y los valores mínimo y máximo de los datos, sobre un rectángulo, alineado
horizontal o verticalmente. Ejemplo Realizaremos un boxplot a las variables hijos y genero.
l i b r a r y ( ggplot2 )
df<− baseDeDatos
27
2.6.5. Histograma
Un histograma es una representación gráfica de una variable en forma de barras, donde la super-
ficie de cada barra es proporcional a la frecuencia de los valores representados. Sirven para obte-
ner una "primera vista"general, o panorama, de la distribución de la población, o de la muestra,
respecto a una característica, cuantitativa y continua (como la longitud o el peso). Ejemplo Rea-
lizaremos un histograma a la variable hijos.
h i s t ( x = dc ,
p r o b a b i l i t y = TRUE,
xlab = " Hijos " , ylab = " Fracuencia " ,
col = c ( " blue " , " red " , " yellow " ) ,
main = "Histograma Hijos " )
l i n e s ( density ( dc ) , lwd = 2)
l i n e s ( density ( dc ) ,
col = " black " , l t y = 2 , ps = 20)
28
2.6.6. Pareto
El diagrama de Pareto, también llamado curva cerrada o Distribución A-B-C, es una gráfica para
organizar datos de forma que estos queden en orden descendente, de izquierda a derecha y
separados por barras. Permite asignar un orden de respecto a algunas de las variables de estudio.
Se utilizacon mucha frecuencia debidoa que en él se puede evidenciar gráficamente el principio
de Pareto (pocos vitales, muchos triviales), es decir, que hay muchos problemas sin importancia
frente a unos pocos muy importantes. Mediante la gráfica colocamos los "pocos que son vitales.a
la izquierda y los "muchos triviales.a la derecha. Ejemplo Realizaremos un pareto a la variable
accidentes.
df <− baseDeDatos
dc<− ( df )
t a b l e <− t a b l e ( dc )
pareto . chart ( t a b l e )
29
En plots aparecerá lo siguiente:
30
3 SECTION
Probabilidad
La probabilidad es la medida que permite cuantificar que tan posible es que ocurra un evento
determinado cuando interviene el azar.
P (A ∩ B )
P (A/B ) =
P (A)
P (A ∩ B ) = P (A/B ) · P (A)
A esta expresión se le llama principio de la probabilidad compuesta. Por ejemplo, vamos a cal-
cular la probabilidad del rango en el lanzamiento de 3 dados de tres formas diferentes en R.
# primera forma
rango . dados1<− function (n ) {
b1<−matrix ( 0 , n , 3 )
b1<−sapply ( 1 : n , function ( x ) { sample ( 1 : 6 , 3 , T ) } )
r<−apply ( b1 , 2 ,max)−apply ( b1 , 2 , min)
prob<−t a b l e ( r ) /n
return ( prob )
31
}
rango . dados1 (100)
Para ejecutar este código tenemos en cuenta las aplicaciones de apply, table y se va a ejecutar
en 100 pasos y el resultado será de la siguiente manera.
# segunda forma
rango . dados2<− function (n ) {
b1<−rep ( 0 ,n)
f o r ( i in 1 :n) {
b1 [ i ]= d i f f ( range ( sample ( 1 : 6 , 3 , T ) ) )
}
prob<−t a b l e ( b1 ) /n
return ( b1 )
}
rango . dados2 (100)
Y obtenemos siguiente:
Por ultimo la ultima sentencia de código que vamos a utilizar va hacer de la siguiente manera
# t e r c e r a forma
rango . dados3<−function (n ) {
b1<−c ( )
b1<−r e p l i c a t e (n , sample ( 1 : 6 , 3 , T ) )
r1<−apply ( b1 , 2 ,max)−apply ( b1 , 2 , min)
prob<−t a b l e ( r1 ) /n
return ( prob )
}
rango . dados3 (100)
Ejecutando deben aparecer los vectores que se evalúan en las posiciones del 1 al 6. Así:
32
3.2. Bayes
Teorema de Bayes Sea B 1 , .., B n donde es una partición de de los posibles resultados, tal que
en cada una de estas particiones la probabilidad sea distinta de cero (0). Sea B un suceso cual-
quiera del que se conocen las probabilidades condicionales P (B |A). Entonces, la probabilidad
P (A|B ) viene dada por la expresión:
P (B /A)P (A)
P (A/B ) =
P (B )
Donde:
Problema Una empresa que fabrica celulares tiene dos maquinas A y B, cada maquina fabrica
el 60 % y 40 % de los celulares respectivamente y cada maquina tiene un 5 % y 10 % respectiva-
mente de celulares defectuosos entonces ¿Cuál es la probabilidad de que el celular haya sido
fabricado por la maquina A sabiendo que es defectuoso?
33
Solución Sabemos que los porcentajes 0.6 y 0.4 corresponden a la proporción de toda la pro-
ducción que lleva a cabo cada máquina, así mismo conocemos los porcentajes que determinan
la probabilidad de que un celular salga defectuoso en cada máquina, corresponientemente 0.05
y 0.10. Al introducir estos valores en nuestro programa anterior obtenemos: Por ende como nos
n!
P (x) = p x q n−x
(n − x)!x!
Donde:
p= Probabilidad de éxito
q= Probabilidad de fracaso
x= Variable aleatoria
n= Número de ensayos
qbinom y rbinom. Los percentiles de la distribución y para los valores binomiales gene-
rados.
Ejemplo Imaginemos que un 80 % de las personas en el mundo han visto el partido del final
del último mundial de fútbol. Tras el evento, 4 amigos se reúnen a conversar ¿Cuál es la proba-
bilidad de que 3 de ellos hayan visto el partido?
En R
n <− 4
p<− 0.8
x <− 3
dbinom( x , n , p)
Obtenemos: es decir, la probabilidad de que 3 de ellos hayan visto el partido es del 40.96 %.
34
3.4. Distribución de Poisson
Esta distribución es una de las más importantes distribuciones de variable discreta, los experi-
mentos que resultan en valores numéricos de un X y que representan el número de resultados
durante un intervalo de tiempo dado o en una región específica frecuentemente se conocen
como experimentos Poisson. Y se define como:
µx · e −µ
P (x) =
x!
Veamos el siguiente ejemplo: Suponga que los accidentes de una calle siguen un proceso de
Poisson con una taza de 2 accidentes por semana. Hallar la probabilidad de que se comentan 5
accidentes durante la próxima semana.
Solución Vamos a calcular mediante la función pois al igual que la función binomial tiene las
mismas características, dpois, ppois, qpois y rpois dpois es para la x = X probabilidad acumu-
lada se usa ppois, la inversa de la función de distribución, es decir, los percentiles qpois y rpois
se usa para los valores binomiales generados.
Primero se debe hallar lambda, teniendo en cuenta que si hay 2 accidentes por 1 (una) sema-
na, entonces por 5 accidentes en la siguiente semana entonces tenemos que calcular la media y
se encuentra que es dos, ese es el valor de lambda.
x<−5
lambda<−2
dpois ( x , lambda )
35
Para estandarizar un valor de X :
x −µ
Z=
σ
Donde µ es la media y σ es la distribución estándar. En R para hacer una distribución normal
utilizamos la siguiente función norm al igual que las distribuciones de Poisson y binomial tiene:
Problema La temperatura durante septiembre está distribuida normalmente con media 18,7°C
y desviación estándar 5°C. Calcule la probabilidad de que la temperatura durante setiembre esté
por debajo de 21°C.
x<−21
media<−18.7
desvia <−5
pnorm( x , media , desvia )
Y obtenemos:
Las pruebas de hipótesis, son procedimientos de decisión basado en datos que permiten produ-
cir una conclusión acerca de algún planteamiento o estudio científico. Una hipótesis estadística
es una afirmación o conjetura acerca de una o más poblaciones.
Tener en cuenta
Hipótesis nula H0 : µ = µ0 ; µ ≤ µ0 ; µ ≥ µ0
Los resultados de esta prueba indican si se debe rechazar o no se puede rechazar la hipótesis
nula de que los datos provienen de una población distribuida normalmente.
36
Vamos a usar la prueba de normalidad de Kolmogorov-Smirnov y de Shapiro Wilk
s e t . seed (100)
muestra<− rnorm (n=100 ,mean=170 , sd =19)
plot ( density ( muestra ) )
l i b r a r y ( nor tes t )
l i l l i e . t e s t ( muestra ) $p . value
s e t . seed ( 5 0 )
muestra<− rnorm (n=5 ,mean=10 , sd =4)
plot ( density ( muestra ) )
l i b r a r y ( nor tes t )
shapiro . t e s t ( muestra ) $p . value
37
Figura 3: respuesta Shapiro Wilk
pruebas, para tratar de encontrar cual se debe rechazar. Cuando se trabaja con varianza se utili-
za chi 2 que es una prueba de hipótesis que compara la distribución observada de los datos con
una distribución esperada de los datos. Vamos a utilizar R para crear una hipótesis, para usar
chi 2 en R debemos usar [Link]. Ejemplo: Tenemos la siguiente tabla donde encontramos
una distribución de fumadores y la frecuencia con la que consumen tabaco. Para llevara cabo el
test chi cuadrado en R.
Y obtenemos:
38
3.8. Prueba de media
Estaprueba se utiliza para probar una afirmación con respecto a la media de una población úni-
ca. En vez de estimar el valor de un parámetro, en ocasiones se debe decidir si una afirmación
relativa a un parámetro es verdadera o falsa, en cuyo caso vamos a usar la prueba t que se utiliza
cuando deseamos comparar dos medias (las cuentas se deben medir en una escala de intervalo
o de cociente). Vamos realizarlo en R de una prueba T.
s e t . seed ( 1 0 )
x1 <− rnorm(100 ,10)
x2 <− rnorm ( 1 0 0 , 1 0 . 5 )
t e s t <− t . t e s t ( x1 , x2 )
print ( test )
Y obtenemos
Como el p-value es < 0.05 podemos afirmar que las muestras difieren en su media, es decir, las
dos variables son diferentes. Con un gráfico de cajas se puede ayudar a interpretar este resultado,
las medias se indican mediante un punto azul:
y se obtiene
39
40