0% encontró este documento útil (0 votos)
3 vistas41 páginas

Laboratorio RStudio

El documento es un manual sobre el uso de R y Python para la estadística y probabilidad, dirigido a estudiantes. Incluye secciones sobre la instalación de ambos lenguajes, conceptos de estadística descriptiva, y fundamentos de probabilidad. Además, proporciona ejemplos prácticos y código fuente para facilitar el aprendizaje.

Cargado por

dhanna B
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas41 páginas

Laboratorio RStudio

El documento es un manual sobre el uso de R y Python para la estadística y probabilidad, dirigido a estudiantes. Incluye secciones sobre la instalación de ambos lenguajes, conceptos de estadística descriptiva, y fundamentos de probabilidad. Además, proporciona ejemplos prácticos y código fuente para facilitar el aprendizaje.

Cargado por

dhanna B
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

M ANUAL ESTADÍSTICA Y PROBABILIDAD

CON P YTHON Y R

R EALIZADO POR :

G LEN N ICOLÁS R ICO


M AYKOLL G IL
M IGUEL G ÓMEZ
Índice
1. Breve introducción a R y Python 3
1.1. Descarga e instalación de R y R-Studio . . . . . . . . . . . . . . . . . . 3
1.1.1. Instalación de R (Si no desea instalar r-studio) . . . . . . . . . 4
1.1.2. Instalación de R-studio . . . . . . . . . . . . . . . . . . . . . . 5
1.2. Descarga de Python . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
1.3. Código Fuente de los ejemplos presentados en el manual . . . . . . . 9
1.4. El lenguaje R . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
1.4.1. El entorno . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
1.4.2. Sintáxis . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
1.4.3. Definición y declaración de variables . . . . . . . . . . . . . . 10

2. Estadística Descriptiva 13
2.1. Descripción . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13
2.1.1. Tipos de variables . . . . . . . . . . . . . . . . . . . . . . . . . . 13
2.1.2. Datos y clasificación . . . . . . . . . . . . . . . . . . . . . . . . 15
2.2. Medidas de tendencia central . . . . . . . . . . . . . . . . . . . . . . . 17
2.2.1. Media o promedio . . . . . . . . . . . . . . . . . . . . . . . . . 17
2.2.2. Mediana . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
2.2.3. Moda . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
2.3. Medidas de posición . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
2.3.1. Cuartiles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
2.3.2. Percentiles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
2.4. Medidas de dispersión . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
2.4.1. Rango . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
2.4.2. Desviación estandar . . . . . . . . . . . . . . . . . . . . . . . . 21
2.4.3. Varianza . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
2.4.4. Coeficiente de variación . . . . . . . . . . . . . . . . . . . . . . 22
2.4.5. Error estándar . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
2.5. Tablas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
2.5.1. Frecuencia absoluta . . . . . . . . . . . . . . . . . . . . . . . . 22
2.5.2. Frecuencia relativa . . . . . . . . . . . . . . . . . . . . . . . . . 23
2.5.3. Frecuencia absoluta acumulada . . . . . . . . . . . . . . . . . 23
2.5.4. Frecuencia relativa acumulada . . . . . . . . . . . . . . . . . . 24
2.6. Gráficas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.6.1. Barras . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.6.2. Barras apiladas . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
2.6.3. Pie . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
2.6.4. Boxplot . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27

1
2.6.5. Histograma . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
2.6.6. Pareto . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29

3. Probabilidad 31
3.1. Probabilidad condicionada . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.2. Bayes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33
3.2.1. Teorema de Bayes . . . . . . . . . . . . . . . . . . . . . . . . . . 33
3.3. Distribución binomial . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
3.4. Distribución de Poisson . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
3.5. Distribución Z normal . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
3.6. Intervalos de confianza . . . . . . . . . . . . . . . . . . . . . . . . . . . 36
3.6.1. Pruebas de hipótesis . . . . . . . . . . . . . . . . . . . . . . . . 36
3.6.2. Prueba de normalidad . . . . . . . . . . . . . . . . . . . . . . . 36
3.7. Prueba de varianza . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
3.8. Prueba de media . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39

Acerca de éste documento

Este documento fue creado para el beneficio de todos los estudiantes que desean utilizar R
y Python para entender algunos conceptos de probabilidad y estadística.

2
Breve introducción a R y
1 Python
SECTION

En esta sección vamos a preparar el entorno con el que se van a ejecutar todos los ejemplos pre-
sentados en este libro, por lo que si ya tiene alguna instalación de R y Python sólo resta verificar
la versión, a fecha de este documento las versiones estables que utilizaremos son:

R 3.5.3

R-studio 1.2.5019

Python 3.8.

en este manual no vamos a profundizar en el lenguaje, por lo que una versión compatible con
python 3 es suficiente para los ejemplos que vamos a ver aquí.

1.1. Descarga e instalación de R y R-Studio


R es un lenguaje y entorno de de código libre bajo la licencia GNU y R Studio no esde código
abierto pero es una herramienta muy útil para el manejo de R, y es por ello que lo instalaremos.
Estos son los links de descarga

Para descargar únicamente R ir a[Link] allí se encuentran los


enlaces de descarga de R, se recomienda descargar la versión más estable si hasta ahora
se está iniciando en R.

Si se quiere llevar a cabo una instalación completa junto con R, R-studio es la mejor op-
ción, para descargarlo ir a [Link] allí se encuentra el link que redirige a

3
la versión Free. Usualmente ocurre que se debe elegir la versión de R que se va instalar de-
pendiendo del sistema operativo, en este manual, sin embargo si lleva tiempo utilizando
cualquier sistema operativo encontrará bastante sencilla su instalación.

Nota: La única versión que no se recomienda descargar en cualquier caso es la descarga del
código fuente, si la descarga deberá compilar el código desde cero (from scratch), es mucho más
complicado, sólo se recomienda para usuarios avanzados.

1.1.1. Instalación de R (Si no desea instalar r-studio)

La instalación es muy sencilla, primero ejecute el .exe descargado en la página de R.

Al dar siguiente estamos aceptando los términos de uso de la licencia GNU

, dependiendo de la arquitectura de su computador deberá elegir entre un tipo de instalación,


usualmente el valor por defecto del instalador tiene la elección que requiere

4
En los siquientes pasos daremos siguiente, eventualmente llegaremos a

Al finalizar, ya tendremos instalado R.

1.1.2. Instalación de R-studio

La instalación es muy sencilla, primero ejecute el .exe descargado en la página de R.

5
Al dar siguiente estamos aceptando los términos de uso de la licencia GNU

, dependiendo de la arquitectura de su computador deberá elegir entre un tipo de instalación,


usualmente el valor por defecto del instalador tiene la elección que requiere

6
En los siquientes pasos daremos siguiente, eventualmente llegaremos a

Al finalizar, ya tendremos instalado R.

1.2. Descarga de Python


La instalación es muy sencilla, primero ejecute el .exe descargado en la página de R.

7
Al dar siguiente estamos aceptando los términos de uso de la licencia GNU

, dependiendo de la arquitectura de su computador deberá elegir entre un tipo de instalación,


usualmente el valor por defecto del instalador tiene la elección que requiere

8
En los siquientes pasos daremos siguiente, eventualmente llegaremos a

Al finalizar, ya tendremos instalado R.

1.3. Código Fuente de los ejemplos presentados en el manual


Los fuentes de la construcción de este libro así como los ejemplos se encuentran en LINK DE
GITHUB.

1.4. El lenguaje R
El lenguaje R es un lenguaje y entorno para el desarrollo de aplicaciones estadísticas, compu-
tacionales y gráficas.

9
R ofrece un amplio conjunto de herramientas estadísticas (para modelamiento, pruebas de
hipótesis), herramientas gráficas y es altamente extensible, actualmente es uno de los proyec-
tos de software libre más grandes del mundo, lo cual es una de sus fortalezas ya que al ser un
proyecto de código abierto (en el que cualquiera puede aportar) toda la comunidad que utilza
el software se beneficia de las contribuciones de todos, haciendo que R sea una herramienta en
crecimiento y de uso extendido.

Este lenguaje tiene soporte para diferentes sistemas operativos.

1.4.1. El entorno

Cuando decimos que R también es un entorno, es debido a que no sólamente tiene las funciones
que normalmente encontramos en un lenguaje de programación sino que también tiene un
amplio abanico en crecimiento de ’paquetes’1 para manipulación de texto, carga de archivos
que a su vez pueden ser extendidas. R ha sido escrito deuna manera muy similar a los lenguajes
de programación interpretados con el rendimiento del lenguaje de programación C.

1.4.2. Sintáxis

Como todo lenguaje debemos comprender algunas reglas básicas, a éstas reglas las conocemos
como la sintáxis del lenguaje, dentro de esto encontramos varias categorías:

Definición y declaración de variables. En todo lenguaje declaramos variables por lo que


aprenderemos a definir variables junto con los tipos de datos en un programa R.

Operadores. Repasaremos las operaciones básicas en R.

Estructuras de control. Aquí ubicamos a las estructuras condicionales, condiciones en


donde evaluamos el valor de verdad de una sentencia que permite alterar el flujo de un
programa.

Estructuras de repetición. Aquí se encuentran las estructuras que nos permiten iterar,
por ejemplo recorrer un archivo.

Funciones. Son piezas de código, que nos ayudan a organizar el código. En general son
una muy buena práctica de programación.

1.4.3. Definición y declaración de variables

Primero repasaremos sobre los tipos de datos en R. R utiliza el paradigma de la orientación a


objetos al límite, cada elemento en R es un objeto. R tiene 6 tipos de datos:

caracter. .a", "b", "hola"

numérico. 2, 3, 3.14

entero. 28L, 3L. el caracter L le indica a R que almacene el dato como un entero.
1
Que son componentes adicionales que se pueden instalar según sea necesario.

10
lógico. TRUE, FALSE.

complejo. 3+14i. En este manual no utilizaremos este tipo de datos para los problemas
que manejamos es suficiente con los reales.

Ejemplo:

x <- "Hola"
x

Salida:

[1] "Hola"

De esta forma acabamos de declarar una variable en R. Nótese que no fue necesario llevar a cabo
una declaración del tipo de variable, R se encarga de asignar el tipo de dato dependiendo de lo
que recibe. Por ejemplo:

x <- 1
x

Salida:

[1] 1

Adicionalmente R también se encuentra provisto de funciones que nos permiten identificar pro-
piedades de los objetos que declaramos:

class(). Nos permite obtener la clase a la que está asociada a un objeto.

typeof(). Nos permite obtener el tipo de dato de de una variable.

length(). Nos permite obtener la longitud de un tipo de dato.

attributes(). nos permite conocer si un objeto tiene determinados metadatos.

Ejemplo:

x <- 1L
class(x)
typeof(x)
length(x)
attributes(x)

Salida:

class(x)
[1] "integer"
typeof(x)
[1] "integer"
length(x)
[1] 1
attributes(x)
[1] NULL

11
Cuando declaramos el tipo de dato sabíamos que era un entero, es por ello que obtenemos como
tipo de dato y clase integer, como solo hemos ocupado 1 byte para almacenar el valor ’1’ ob-
tenemos como valor de la función 1. Finalmente, x es un valor escalar, es por ello que no posee
atributos y obtenemos el valor NULL, que indica que no tiene ningún atributo.

R cuenta con estructuras de datos para contener colecciones, nombraremos algunas de ellas:

vectores atómicos.

listas.

matrices.

data frame.

factores.

En aplicaciones estadísticas encontraremos que es muy frecuente el uso de este tipo de estruc-
turas. Los vectores se pueden declarar con varias funciones, las más comunes son vector,
logical, character, integer, numeric.

Ejemplo:

vector()
vector("character", length = 5)

Salida

vector()
[1] logical(0)
vector("character", length = 5)
[1] "" "" "" "" ""

Con las funciones anteriores podemos analizar estos objetos.

Matrices las matrices son una extensión de los vectores pero tienen varias mas de una di-
mensión. Ejemplo:

m <- matrix(nrow = 2, ncol = 2)


m

Salida:

[,1] [,2]
[1,] NA NA
[2,] NA NA

12
2
Listas Las listas en R actúan como contenedores. A diferencia de los vectores atómicos las
listas puden contener diferentes tipos de datos, por ejemplo:

x <- list(1, "hola", TRUE, 3+14i)


x

salida:

[[1]]
[1] 1
[[2]]
[1] "hola"
[[3]] SECTION
[1] TRUE
[[4]] Estadística Descriptiva
[1] 3 + 14i

2.1. Descripción
La estadística descriptiva es la estadística que recolecta, presenta y caracteriza un conjunto de
datos (por ejemplo, la edad de una población, la altura de los estudiantes de una escuela, tem-
peratura en los meses de verano, etc.) con el fin de describir apropiadamente las diversas carac-
terísticas de ese conjunto. Al conjunto de los distintos valores numéricos que adopta un carácter
cuantitativo se llama variable estadística. Y existen de diferentes tipos.

2.1.1. Tipos de variables

Las variables se clasifican de diversas maneras según el atributo que poseen, en estadística des-
criptiva se clasifican en:

Variables cualitativas o categóricas, estas son las que no se pueden medir numéricamente
(o de manera cuantitativa).

Ejemplos

• Nacionalidad.

• Color de piel.

• Sexo.

Variables cuantitativas, estas tienen un valor numérico. Son valores que podemos cuanti-
ficar y relacionar con un número.

13
También se clasifican por su dimensión:

Variables unidimensionales. Estas contienen la información sobre una característica.

Ejemplos

• Edad de los alumnos de una clase.

Variables bidimensionales. Estas contienen información sobre dos características de la


población.

Ejemplos

• Edad y altura de los alumnos de una clase.

Variables pluridimensionales: recogen información sobre tres o más características.

Ejemplo

• Edad, altura y peso de los alumnos de una clase

Para las varaiables cuantitativas existe una segunda categorización, esta se da según el tipo de
número que contienen, estas pueden ser discretas o continuas.

Las variables discretas son aquellas que sólo pueden tomar valores enteros (1, 2, −4, et c.)

Ejemplo

• Número de hermanos, solo pueden ser 1, 2, 3...et c nunca podrá ser 3, 45.

Las variables continuas son aquellas que pueden tomar cualquier valor real dentro de un
intervalo.

Ejemplo

• La velocidad de un vehículo puede ser 90.4km/h, 94.57km/h...et c.

Cada variable tiene un comportamiento diferente y un tratamiento diferente, por lo que de-
bemos aprender a reconocer algunas definiciones

Individuo Cualquier elemento que porte información sobre el fenómeno que se estudia. Así,
si estudiamos la altura de los niños de una clase, cada alumno es un individuo; si se estudia el
precio de la vivienda, cada vivienda es un individuo.

Población: Es el conjunto de todos los individuos (personas, objetos, animales, etc.) que por-
ten información sobre el fenómeno que se estudia. Por ejemplo, si se estudia el precio de la vi-
vienda en una ciudad, la población será el total de las viviendas de dicha ciudad.

14
Muestra Es un subconjunto que seleccionado de una población. Por ejemplo, si se estudia el
precio de la vivienda de una ciudad, lo normal será no recoger información sobre todas las vi-
viendas de la ciudad (sería una labor muy compleja), sino que se suele seleccionar un subgrupo
(muestra) que se entienda que es suficientemente representativo.

2.1.2. Datos y clasificación

Los datos pueden concebirse como información necesaria para ayudar a tomar una decisión
con mayores fundamentos en una situación particular. Los datos son medidas y/o números re-
copilados a partir de la observación o instrumentos (como encuestas). Existen varios métodos
con los cuales se pueden obtener datos necesarios, se pueden buscar datos ya publicados por
otras fuentes o publicaciones científicas.

Figura 1: En el centro de la galaxia M87, se encuentra este agujero negro supermasivo.

Acerca de esta imágen Para lograr la construcción de esta imágen se requirieron procesar
mas de 5 Petabytes entre diversos observatorios. Ningún canal de comunicación sería eficiente
para transportar esta cantidad de información, debido a ello se decidió enviar los discos duros en
donde estaba almacenada la información recopilada, es un ejemplo muy claro de utilizar técnicas
de recopilación de datos junto con modelos para construir y predecir una imágen de como se ve el
agujero negro.

También, se pueden diseñar experimentos y conducir estudios para recopilar los datos. En
algunos casos se pueden hacer observaciones del comportamiento, actitudes y opiniones de los
individuos en los que se está interesado en estudiar, en otros casos se utilizan modelos matemá-
ticos para construir un conjunto de datos.

Medir en el campo de las ciencias exactas es comparar una magnitud con otra, tomada de
manera una manera no arbitraria como referencia. En el campo de las ciencias sociales medir es

15
“el proceso de vincular conceptos abstractos con indicadores empíricos”. Al resultado de medir
se le llama medida.

La medición de las variables puede realizarse por medio de cuatro escalas de medición: la no-
minal, ordinal, de intervalo y de razón. Se utilizan para ayudar en la clasificación de las variables,
el diseño de las preguntas para medir variables, e incluso indican el tipo de análisis estadístico
apropiado para el tratamiento de los datos, las mediciones y los datos son la escencia de la esta-
dística y del análisis estadístico.

Una característica esencial de la medición es la dependencia que tiene de la posibilidad de


variación. Ante lo anterior la validez y la confiabilidad de la medición de una variable depende de
las decisiones que se tomen para operarla y lograr un adecuada comprensión del fenómeno de
estudioy sus conceptos evitando así imprecisiones y ambigüedades, en caso contrario también
se puede concluir que la variable no es útil para el estudio y por ende debe evaluarse si deberá
ser invalidada debido a que no produce información confiable.

Existen cuatro categorías en las que se realizan las mediciones

Medición Nominal: O por categorías. En este nivel de medición se establecen las catego-
rias distintivas que no implican un orden específico. Por ejemplo, si la unidad de análisis
es un grupo de personas, para clasificarlas se puede establecer la categoría sexo con dos
niveles, masculino (M) y femenino (F), los encuestados sólo tienen que señalar su género,
no se requiere de un orden real. Así, se pueden asignar números a estas categorías para
su identificación: 1 = M , 2 = F o bien, se pueden invertir los números sin que afecte la
medición: 1 = F y 2 = M . En resumen, en la escala nominal se asignan números a eventos
con el propósito de identificarlos.

Medición Ordinal: O por orden. Se establecen categorías con dos o más niveles que im-
plican un orden inherente entre si. La escala de medición ordinal es cuantitativa porque
permite ordenar a los eventos en función de la mayor o menor debido a la posesión de
un atributo o característica. Por ejemplo, en las instituciones escolares de nivel básico
suelen formar por estatura a los estudiantes, se desarrolla un orden cuantitativo pero no
suministra medidas de los sujetos. Estas escalas admiten la asignación de números en
función de un orden prescrito. Las formas más comunes de variables ordinales son ítems
(reactivos2 ) actitudinales estableciendo una serie de niveles que expresan una actitud de
acuerdo o desacuerdo con respecto a algún referente. Por ejemplo, ante el reactivo: Pemex
debe privatizarse, el respondiente puede marcar su respuesta de acuerdo a las siguientes
alternativas:

• Totalmente de acuerdo.

• De acuerdo.

• Indiferente.
2
La posición de una persona frente a algo

16
• En desacuerdo.

• Totalmente desacuerdo.

Las anteriores alternativas de respuesta pueden codificarse con números que van del uno
al cinco y que sugieren un orden preestablecido pero no implican una distancia entre un
número y otro.

Medición de Intervalo: La medición de intervalo posee las características de la medición


nominal y ordinal. Establece la distancia entre una medida y otra. La escala de intervalo
se aplica a variables continuas pero carece de un punto cero absoluto. El ejemplo más
representativo de este tipo de medición es un termómetro, cuando registra cero grados
centígrados de temperatura indica el nivel de congelación del agua y cuando registra 100
grados centígrados indica el nivel de ebullición, el punto cero es arbitrario no real, lo que
significa que en este punto no hay ausencia de temperatura.

Medición de Razón: Una escala de medición de razón incluye las características de los
tres anteriores niveles de medición (nominal, ordinal e intervalo). Determina la distancia
exacta entre los intervalos de una categoría. Adicionalmente tiene un punto cero absoluto,
es decir, en el punto cero no existe la característica o atributo que se mide. Las variables
de ingreso, edad, número de hijos, etc. son ejemplos de este tipo de escala. El nivel de
medición de razón se aplica tanto a variables continuas como discretas.

2.2. Medidas de tendencia central


Teniendo en cuenta las definiciones anteriores, definimos las medidas de tendencia central co-
mo los indicadores de que tan uniforme es una distribución de datos en general, en cierta me-
dida la intención de estas medidas es hacerse una idea de toda la población en general. Para
cada ejemplo trabajaremos con los siguentes datos , importados de un excel a r. Lo haremos de
la siguiente forma:

l i b r a r y ( readxl )
## L i b r e r i a que l e e l o s archivos
DB <− read_excel ( " baseDeDatos . x l s x " , sheet = "BD CUALI − CUANTI" )
## Ubicacion del archivo y que hoja q u i s i e r a importar
View (DB)

2.2.1. Media o promedio

La medida de tendencia central mas conocida y utilizada es la media aritmética o promedio


aritmético. Se representa por la letra griega µ, cuando se trata del promedio del universo o po-
blación y (léase "Y barra") cuando se trata del promedio de la muestra. Es importante destacar
que µ es una cantidad fija mientras que el promedio de la muestra es variable puesto que dife-
rentes muestras extraídas de la misma población tienden a tener diferentes medias. La media se
expresa en la misma unidad que los datos originales: centímetros, horas, gramos, etc.
Ejemplo: Encontraremos la media de una de las filas de los datos, obtaremos por hijos en este

17
caso debemos usar la transpuesta de la matrix para que el codigo funcióne lo cual se hará con el
siguiente codigo:

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

mean( dc )

En consola aparecera lo siguiente:

También se puede obtener la media recortada, la cual recorta una proporción de observaciones
por ambos lados de la distribución.

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

mean( dc , trim = 0 . 2 )

En consola aparecera lo siguiente:

2.2.2. Mediana

Otra medida de tendencia central es la mediana. La mediana es el valor de la variable que ocupa
la posición central, cuando los datos se disponen en orden de magnitud. Es decir, el 50 % de las
observaciones tiene valores iguales o inferiores a la mediana y el otro 50 % tiene valores iguales
o superiores a la mediana. Ejemplo Encontraremos la mediana de una de las filas de los datos,
obtaremos por hijos en este caso debemos usar la transpuesta de la matrix para que el codigo
funcióne lo cual se hará con el siguiente código:

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

median ( dc )

En consola aparecerá lo siguiente:

18
2.2.3. Moda

La moda de una distribución se define como el valor de la variable que mayorfrecuencia tie-
ne. En un polígono de frecuencia, la moda corresponde al valor de la variable que está bajo el
punto más alto del gráfico. Una muestra puede tener más de una moda. Ejemplo Encontrare-
mos la moda de una de las filas de los datos, obtaremos por hijos en este caso debemos usar la
transpuesta de la matrix para que el programa se ejecute correctamente:

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

t a b l e ( dc )

En consola aparecerá lo siguiente:

2.3. Medidas de posición

2.3.1. Cuartiles

Los cuartiles son los tres valores que dividen al conjunto de datos ordenados en cuatro partes
porcentualmente iguales. Hay tres cuartiles denotados usualmente Q1, Q2, Q3. El segundo cuar-
til es precisamente la mediana. El primer cuartil, es el valor en el cual o por debajo del cual queda
un cuarto (25 %) de todos los valores de la sucesión (ordenada); el tercer cuartil, es el valor en el
cual o por debajo del cual quedan las tres cuartas partes (75 %) de los [Link] Encontra-
remos los cuartiles de una de las filas de los datos, obtaremos por el número de hijos en este caso
debemos usar la transpuesta de la matrix para que el programa se ejecute correctamente:

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

quantile ( dc )

En consola aparecerá lo siguiente:

19
2.3.2. Percentiles

Los percentiles son, tal vez, las medidas mas utilizadas para propósitos de ubicación o clasifica-
ción de las personas cuando atienden características tales como peso, estatura, etc. Los percen-
tiles son ciertos números que dividen la sucesión de datos ordenados en cien partes porcentual-
mente iguales. Estos son los 99 valores que dividen en cien partes iguales el conjunto de datos
ordenados. Los percentiles (P1, P2,... P99), leídos "primer percentil", ..., "percentil 99". Ejemplo
Encontraremos los percentiles de una de las filas de los datos, obtaremos por hijos en este caso
debemos usar la transpuesta de la matrix para que el programa se ejecute correctamente:

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

quantile ( dc , 0 . 2 5 )

En consola aparecerá lo siguiente:

2.4. Medidas de dispersión


Las medidas de dispersión nos permiten conocer de manera general a toda la población, pero
a diferencia de las medidas de tendencia central, estas medidas nos permiten conocer que tan
diferentes es la población.

2.4.1. Rango

El Rango es el intervalo entre el valor máximo y el valor mínimo; por ello, comparte unidades
con los datos. Permite obtener una idea de la dispersión de los datos, cuanto mayor es el rango,
más dispersos están los datos (sin considerar la afectación de los valores extremos). El rango,
también es llamado amplitud o recorrido. Ejemplo Encontraremos el rango de una de las filas
de los datos, obtaremos por el número de hijos, en este caso debemos usar la transpuesta de la
matrix para que el programa funcione correctamente:

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

range ( dc )

20
En consola aparecerá lo siguiente:

2.4.2. Desviación estandar

La desviación estándar es la medida de dispersión mas común, indica que tan dispersos estan
los datos con respecto a la media. Mientras mayor sea la desviación estándar, mayor será la
dispersión de los datos. Ejemplo Encontraremos la desviación estandar del número de hijos.

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

sd ( dc )

En consola aparecerá lo siguiente:

2.4.3. Varianza

La varianza mide qué tan dispersos están los datos alrededor de la media. La varianza es igual
a la desviación estándar elevada al cuadrado. Es una medida adicional que se utiliza tambien
para compararse respectoa la media, sin embargo debido a que depende de la desviación, si
la desviación es muy alta, la varianza se incrementará al cuadrado, lo que la convierte en una
medida inconveniente en algunos casos. Ejemplo Encontraremos la varianza del número de
hijos.

df<− baseDeDatos [ , " Hijos " ]

var ( df )

En consola aparecerá lo siguiente:

21
2.4.4. Coeficiente de variación

El coeficiente de variación permite comparar las dispersiones de dos distribuciones distintas,


siempre y cuando sus medias sean positivas. Ejemplo Encontraremos el coeficiente de variación
de una de las filas de los datos, obtaremos por el número de hijos.

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

CV <− function ( dc ) { sd ( dc ) * 100/mean( dc ) }


CV( dc )

En consola aparecerá lo siguiente:

Se calcula para cada una de las distribuciones y los valores que se obtienen se comparan entre
sí. La mayor dispersión corresponderá al valor del coeficiente de variación mayor.

2.4.5. Error estándar

2.5. Tablas
Es de utilidad en el análisis estadístico obtener los resultados del análisis en un único lugar, es
por ello que existen las tablas, esta sección será mucho más práctica veremos como obtener en
R algunos de los valores que se requieren con mayor frecuencia.

2.5.1. Frecuencia absoluta

La frecuencia absoluta es una medida estadística que nos da información acerca de la cantidad
de veces que se repite un suceso al realizar un número determinado de experimentos aleatorios.
Ejemplo Encontraremos la tabla de frecuencia absoluta de una de las filas de los datos, obtare-
mos por el número de hijos.

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

t a b l e ( dc )

En consola aparecerá lo siguiente:

22
2.5.2. Frecuencia relativa

La frecuencia relativa es el cociente entre la frecuencia absoluta de un determinado valor y el


número total de datos. Ejemplo Encontraremos la tabla de frecuencia relativa de una de las filas
de los datos, obtaremos por el número de hijos.

df<− baseDeDatos [ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

t a b l e ( dc ) / length ( dc )

En consola aparecerá lo siguiente:

2.5.3. Frecuencia absoluta acumulada

La frecuencia absoluta acumulada es el resultado de ir sumando las frecuencias absolutas de


las observaciones o valores de una población o muestra. Ejemplo Encontraremos la tabla de
frecuencia absoluta acumulada de una de las filas de los datos, obtaremos por el número de
hijos.

df<− DB[ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

cumsum( t a b l e ( dc ) )

En consola aparecerá lo siguiente:

23
2.5.4. Frecuencia relativa acumulada

La frecuencia relativa acumulada es el resultado de ir sumando las frecuencias relativas de las


observaciones o valores de una población o muestra. Ejemplo Encontraremos la tabla de fre-
cuencia relativa acumulada de una de las filas de los datos, obtaremos por el número de hijos.

df<− DB[ , " Hijos " ]


dc<−t ( df ) ## Nos da l a transpuesta del vector

cumsum( t a b l e ( dc ) / length ( dc ) )

En consola aparecerá lo siguiente:

2.6. Gráficas
Las gráficas y las tablas son las herramientas que nos permiten observar gráficamente la pobla-
ción. Para las gráficas usaremos el paquete ggplot2, si no tenemos el paquete intalado podemos
usar el siguente comando:

i f ( ! any ( grepl ( " ggplot2 " , i n s t a l l e d . packages ( ) ) ) ) {


i n s t a l l . packages ( " ggplot2 " , dependencies = TRUE)
}

2.6.1. Barras

Un diagrama de barras, también conocido como gráfico de barras o gráfico de columnas, es una
forma de representar gráficamente un conjunto de datos o valores, y está conformado por barras
rectangulares de longitudes proporcionales a los valores representados. Los gráficos de barras
son usados para comparar cantidades de valores en diferentes momentos, o también podría de-
cirse productos. Las barras pueden orientarse horizontal o verticalmente. Ejemplo Realizaremos
un diagrama de barras a la variable hijos, genero y estado civil.

24
l i b r a r y ( ggplot2 )

df<− baseDeDatos

ggplot ( data=df , aes ( x=Genero


, y=Hijos , f i l l = Estado_Civil ) ) +
geom_bar ( s t a t =" i d e n t i t y " , position ="dodge " )

En plots aparecerá lo siguiente:

2.6.2. Barras apiladas

Es una gráfica donde se apilan una serie de rectángulos (uno sobre otro), en donde el área de ca-
da rectángulo es proporcional a la cantidad que representa. Este tipo de gráfica puede utilizarse
para comparar fácilmente las partes de un todo. Ejemplo Realizaremos un diagrama de barras
apiladas a las variables hijos, genero y estado civil.

l i b r a r y ( ggplot2 )

df<−baseDeDatos

ggplot ( data=df , aes ( x=Genero


, y=Hijos , f i l l = Estado_Civil ) ) +
geom_bar ( s t a t =" i d e n t i t y " , position =" stack " )

En plots aparecera lo siguiente:

25
2.6.3. Pie

Un gráfico circular o gráfica circular, también llamado "gráfico de pastel", "gráfico de tarta",
"gráfico de torta.o "gráfica de 360 grados", es un recurso estadístico que se utiliza para repre-
sentar porcentajes y proporciones. El número de elementos comparados dentro de una gráfica
circular suele ser de más de cuatro. Ejemplo Realizaremos un diagrama de pie a la variable Ac-
cidentes.

l i b r a r y ( ggplot2 )
df<− baseDeDatos

accidentes <− df$ACCIDENTE


pie <− function ( x ) {
t i t l e <− deparse ( s u b s t i t u t e ( x ) )

x <− data . frame ( modality = na . omit ( x ) )


l i b r a r y ( dplyr )

Df <− x %> % group_by ( modality ) %> % summarise ( frequency=n ( ) ) %> %


arrange ( desc ( frequency ) )

Df$modality <− ordered ( Df$modality , l e v e l s


= u n l i s t ( Df$modality , use . names = F ) )

Df <− Df %> %
arrange ( desc ( modality ) ) %> %
mutate ( prop = frequency /sum( frequency ) * 100
, lab . ypos = cumsum( prop ) − 0 . 5 * prop )

mycols <− c ("#0073C2FF" , "#EFC000FF " , "#868686FF " , "#CD534CFF" )

26
g <− ggplot ( Df , aes ( x = " " , y = prop , f i l l = modality ) ) +
geom_bar ( width = 1 , s t a t = " i d e n t i t y " , color = " white " ) +
coord_polar ( " y " , s t a r t = 0)+
geom_text ( aes ( y = lab . ypos
, l a b e l = paste ( prop , " % " ) ) , color = " white ")+
s c a l e _ f i l l _ m a n u a l ( values = mycols ) +
theme_void ( )

return ( g )
}
pie ( accidentes )

En plots aparecerá lo siguiente:

2.6.4. Boxplot

Los diagramas de Caja-Bigotes (boxplots o box and whiskers) son una presentación visual que
describe varias características importantes como la dispersión y la simetría. En ella se represen-
tan los tres cuartiles y los valores mínimo y máximo de los datos, sobre un rectángulo, alineado
horizontal o verticalmente. Ejemplo Realizaremos un boxplot a las variables hijos y genero.

l i b r a r y ( ggplot2 )

df<− baseDeDatos

ggplot ( data=df , aes ( x=Genero , y=Hijos ) ) +


geom_boxplot ( ) +
guides ( f i l l =FALSE )

En plots aparecerá lo siguiente:

27
2.6.5. Histograma

Un histograma es una representación gráfica de una variable en forma de barras, donde la super-
ficie de cada barra es proporcional a la frecuencia de los valores representados. Sirven para obte-
ner una "primera vista"general, o panorama, de la distribución de la población, o de la muestra,
respecto a una característica, cuantitativa y continua (como la longitud o el peso). Ejemplo Rea-
lizaremos un histograma a la variable hijos.

df<− DB[ , " Hijos " ]


dc <− t ( df )

h i s t ( x = dc ,
p r o b a b i l i t y = TRUE,
xlab = " Hijos " , ylab = " Fracuencia " ,
col = c ( " blue " , " red " , " yellow " ) ,
main = "Histograma Hijos " )
l i n e s ( density ( dc ) , lwd = 2)
l i n e s ( density ( dc ) ,
col = " black " , l t y = 2 , ps = 20)

En plots aparecerá lo siguiente:

28
2.6.6. Pareto

El diagrama de Pareto, también llamado curva cerrada o Distribución A-B-C, es una gráfica para
organizar datos de forma que estos queden en orden descendente, de izquierda a derecha y
separados por barras. Permite asignar un orden de respecto a algunas de las variables de estudio.
Se utilizacon mucha frecuencia debidoa que en él se puede evidenciar gráficamente el principio
de Pareto (pocos vitales, muchos triviales), es decir, que hay muchos problemas sin importancia
frente a unos pocos muy importantes. Mediante la gráfica colocamos los "pocos que son vitales.a
la izquierda y los "muchos triviales.a la derecha. Ejemplo Realizaremos un pareto a la variable
accidentes.

i n s t a l l . packages ( " qcc " )


l i b r a r y ( ggplot2 )
l i b r a r y ( qcc )

df <− baseDeDatos
dc<− ( df )
t a b l e <− t a b l e ( dc )
pareto . chart ( t a b l e )

En consola nos mostrará lo siguente:

29
En plots aparecerá lo siguiente:

30
3 SECTION

Probabilidad

La probabilidad es la medida que permite cuantificar que tan posible es que ocurra un evento
determinado cuando interviene el azar.

3.1. Probabilidad condicionada


Mide la probabilidad de un determinado suceso conociendo información previa sobre otro su-
ceso.

Definición Dado dos sucesos A y B tales que B 6= 0, se denomina probabilidad de A condicio-


nada de B y se denota comoP(A/B), tal que

P (A ∩ B )
P (A/B ) =
P (A)

De la fórmula de la probabilidad condicionada se deriva la expresión:

P (A ∩ B ) = P (A/B ) · P (A)

A esta expresión se le llama principio de la probabilidad compuesta. Por ejemplo, vamos a cal-
cular la probabilidad del rango en el lanzamiento de 3 dados de tres formas diferentes en R.

# primera forma
rango . dados1<− function (n ) {
b1<−matrix ( 0 , n , 3 )
b1<−sapply ( 1 : n , function ( x ) { sample ( 1 : 6 , 3 , T ) } )
r<−apply ( b1 , 2 ,max)−apply ( b1 , 2 , min)
prob<−t a b l e ( r ) /n
return ( prob )

31
}
rango . dados1 (100)

Para ejecutar este código tenemos en cuenta las aplicaciones de apply, table y se va a ejecutar
en 100 pasos y el resultado será de la siguiente manera.

Ahora para calcular los vectores usando las simulaciones ejecutamos:

# segunda forma
rango . dados2<− function (n ) {
b1<−rep ( 0 ,n)
f o r ( i in 1 :n) {
b1 [ i ]= d i f f ( range ( sample ( 1 : 6 , 3 , T ) ) )
}
prob<−t a b l e ( b1 ) /n
return ( b1 )
}
rango . dados2 (100)

Y obtenemos siguiente:

Por ultimo la ultima sentencia de código que vamos a utilizar va hacer de la siguiente manera

# t e r c e r a forma
rango . dados3<−function (n ) {
b1<−c ( )
b1<−r e p l i c a t e (n , sample ( 1 : 6 , 3 , T ) )
r1<−apply ( b1 , 2 ,max)−apply ( b1 , 2 , min)
prob<−t a b l e ( r1 ) /n
return ( prob )
}
rango . dados3 (100)

Ejecutando deben aparecer los vectores que se evalúan en las posiciones del 1 al 6. Así:

32
3.2. Bayes

3.2.1. Teorema de Bayes

Teorema de Bayes Sea B 1 , .., B n donde es una partición de de los posibles resultados, tal que
en cada una de estas particiones la probabilidad sea distinta de cero (0). Sea B un suceso cual-
quiera del que se conocen las probabilidades condicionales P (B |A). Entonces, la probabilidad
P (A|B ) viene dada por la expresión:

P (B /A)P (A)
P (A/B ) =
P (B )

Donde:

P(A) son las probabilidades a priori

P(B |A) es la probabilidad de B en la hipótesis A

P(A/B ) son las probabilidades a posteriori.

Ahora vamos a ejecutar un programa que utiliza el teorema de Bayes:

p r i n t ( " ingrese e l porcentaje " )


porcentaje <−c ( scan ( ) )
p r i n t ( " ingrese l a probabilidad " )
prob<−c ( scan ( ) )

funcionb<− function ( porcentaje , prob ) {


suma <− 0.00
f o r ( i in 1 : length ( porcentaje ) ) {
suma<−suma+porcentaje [ i ] * prob [ i ]
}
r e s t a <− 0.00
probabilidad <−c ( )
f o r ( i in 1 : length ( porcentaje ) ) {
resta <−porcentaje [ i ] * prob [ i ] /suma
probabilidad <−c ( probabilidad , r e s t a )
}
return ( probabilidad )
}

p r i n t ( funcionb ( porcentaje , prob ) )

Para probar que en efecto funciona, vamos a ejecutar un problema.

Problema Una empresa que fabrica celulares tiene dos maquinas A y B, cada maquina fabrica
el 60 % y 40 % de los celulares respectivamente y cada maquina tiene un 5 % y 10 % respectiva-
mente de celulares defectuosos entonces ¿Cuál es la probabilidad de que el celular haya sido
fabricado por la maquina A sabiendo que es defectuoso?

33
Solución Sabemos que los porcentajes 0.6 y 0.4 corresponden a la proporción de toda la pro-
ducción que lleva a cabo cada máquina, así mismo conocemos los porcentajes que determinan
la probabilidad de que un celular salga defectuoso en cada máquina, corresponientemente 0.05
y 0.10. Al introducir estos valores en nuestro programa anterior obtenemos: Por ende como nos

interesa el valor para la máquina A, decimos que esta probabilidad es de 0.4285714

3.3. Distribución binomial


Es una tipo de distribución de probabilidad discreta que describe el número de éxitos al realizar
en n experimentos independientes entre sí, acerca de una variable aleatoria. Entendiendo como
una serie de pruebas o ensayos en la que únicamente podemos tener 2 resultados (sea éxito o
fracaso), siendo el éxito nuestra variable aleatoria. Y se define como:
à !
n x n−x
P (x) = p q
r

n!
P (x) = p x q n−x
(n − x)!x!
Donde:

p= Probabilidad de éxito

q= Probabilidad de fracaso

x= Variable aleatoria

n= Número de ensayos

En R ya existe una colección de funciones para distribuciones binomiales:

dbinom para usar la funcion binomial simple

pbinom probabilidad acumulada se usa

qbinom y rbinom. Los percentiles de la distribución y para los valores binomiales gene-
rados.

Ejemplo Imaginemos que un 80 % de las personas en el mundo han visto el partido del final
del último mundial de fútbol. Tras el evento, 4 amigos se reúnen a conversar ¿Cuál es la proba-
bilidad de que 3 de ellos hayan visto el partido?

En R
n <− 4
p<− 0.8
x <− 3
dbinom( x , n , p)

Obtenemos: es decir, la probabilidad de que 3 de ellos hayan visto el partido es del 40.96 %.

34
3.4. Distribución de Poisson
Esta distribución es una de las más importantes distribuciones de variable discreta, los experi-
mentos que resultan en valores numéricos de un X y que representan el número de resultados
durante un intervalo de tiempo dado o en una región específica frecuentemente se conocen
como experimentos Poisson. Y se define como:

µx · e −µ
P (x) =
x!

Veamos el siguiente ejemplo: Suponga que los accidentes de una calle siguen un proceso de
Poisson con una taza de 2 accidentes por semana. Hallar la probabilidad de que se comentan 5
accidentes durante la próxima semana.

Solución Vamos a calcular mediante la función pois al igual que la función binomial tiene las
mismas características, dpois, ppois, qpois y rpois dpois es para la x = X probabilidad acumu-
lada se usa ppois, la inversa de la función de distribución, es decir, los percentiles qpois y rpois
se usa para los valores binomiales generados.

Primero se debe hallar lambda, teniendo en cuenta que si hay 2 accidentes por 1 (una) sema-
na, entonces por 5 accidentes en la siguiente semana entonces tenemos que calcular la media y
se encuentra que es dos, ese es el valor de lambda.

x<−5
lambda<−2
dpois ( x , lambda )

Y tenemos como resultado

3.5. Distribución Z normal


En estadística y probabilidad se llama distribución normal, distribución de Gauss, distribución
gaussiana o distribución de Laplace-Gauss, a una de las distribuciones de probabilidad de va-
riable continua que con más frecuencia aparece en estadística y en la teoría de probabilidades.
Una variable aleatoria continua, X, sigue una distribución normal de media µ y desviación típica
σ, y se designa por N(µ,σ), si se cumplen las siguientes condiciones:

La variable puede tener valores desde (−∞, ∞)

La función de densidad, es la expresión en términos de ecuación matemática de la curva


de Gauss es
1 1 x−µ 2
f (x) = p e − 2 ( σ )
σ 2π

35
Para estandarizar un valor de X :
x −µ
Z=
σ
Donde µ es la media y σ es la distribución estándar. En R para hacer una distribución normal
utilizamos la siguiente función norm al igual que las distribuciones de Poisson y binomial tiene:

dnorm permite obtener la función de densidad de la distribución normal.

pnorm permite obtener la probabilidad acumulada.

qnorm permite obtener los cuartiles.

rnorm permite obtener un vector con valores aleatorios de la distribución normal.

Problema La temperatura durante septiembre está distribuida normalmente con media 18,7°C
y desviación estándar 5°C. Calcule la probabilidad de que la temperatura durante setiembre esté
por debajo de 21°C.

Solución utilizando la función pnorm:

x<−21
media<−18.7
desvia <−5
pnorm( x , media , desvia )

Y obtenemos:

3.6. Intervalos de confianza

3.6.1. Pruebas de hipótesis

Las pruebas de hipótesis, son procedimientos de decisión basado en datos que permiten produ-
cir una conclusión acerca de algún planteamiento o estudio científico. Una hipótesis estadística
es una afirmación o conjetura acerca de una o más poblaciones.

Tener en cuenta

Hipótesis nula H0 : µ = µ0 ; µ ≤ µ0 ; µ ≥ µ0

Hipótesis Alternativa: H1 : µ = µ1 ; µ < µ1 ; µ > µ1 ; µ 6= µ1

Para probar las hipótesis se tiene la prueba de normalidad de Kolmogorov-Smirnov, pruebas de


variabilidad y pruebas de medias.

3.6.2. Prueba de normalidad

Los resultados de esta prueba indican si se debe rechazar o no se puede rechazar la hipótesis
nula de que los datos provienen de una población distribuida normalmente.

36
Vamos a usar la prueba de normalidad de Kolmogorov-Smirnov y de Shapiro Wilk

Prueba de normalidad de Kolmogorov-Smirnov:


Esta prueba compara la función de distribución acumulada empírica de los datos de la
muestra con la distribución esperada si los datos fueran normales. Se va usar la el coman-
do [Link] hace el calculo de Kolmogorov-Smirnov mejorado para usar [Link] tener
en cuenta que se requiere instalar nortest. Vamos a utilizar un ejemplo propio para eso,
teniendo en cuenta que para Kolmogorov-Smirnov se usa para datos mayores a 50.

s e t . seed (100)
muestra<− rnorm (n=100 ,mean=170 , sd =19)
plot ( density ( muestra ) )
l i b r a r y ( nor tes t )
l i l l i e . t e s t ( muestra ) $p . value

y su respuesta y gráfica son las siguientes:

Figura 2: respuesta Kolmogorov-Smirnov

Prueba de normalidad Shapiro Wilk:. Se utiliza para contrastar la normalidad de un con-


junto de datos. Se plantea como hipótesis nula que una muestra: x 1 , ..., x n proviene de una
población normalmente distribuida, en R

s e t . seed ( 5 0 )
muestra<− rnorm (n=5 ,mean=10 , sd =4)
plot ( density ( muestra ) )
l i b r a r y ( nor tes t )
shapiro . t e s t ( muestra ) $p . value

37
Figura 3: respuesta Shapiro Wilk

3.7. Prueba de varianza


Las pruebas de hipótesis para una varianza, son un procedimiento para juzgar si una propie-
dad que se supone cumple una población estadística y es compatible con lo observado en una
muestra de dicha población, en este caso la varianza, para ello formularemos dos Hipótesis: una
llamada "Hipótesis Nula otra llamada "Hipótesis Alternativa", con ellas realizaremos una o más
2

pruebas, para tratar de encontrar cual se debe rechazar. Cuando se trabaja con varianza se utili-
za chi 2 que es una prueba de hipótesis que compara la distribución observada de los datos con
una distribución esperada de los datos. Vamos a utilizar R para crear una hipótesis, para usar
chi 2 en R debemos usar [Link]. Ejemplo: Tenemos la siguiente tabla donde encontramos

una distribución de fumadores y la frecuencia con la que consumen tabaco. Para llevara cabo el
test chi cuadrado en R.

fumar=matrix ( c ( 5 1 , 4 3 , 2 2 , 5 9 , 5 6 , 4 5 , 4 8 , 7 8 , 9 5 ) , ncol =3 ,byrow = TRUE)


colnames ( fumar ) = c ( "mucho" , " poco " , " medio " )
rownames( fumar ) = c ( " actual " , " pasado " , " nunca " )
fumar=as . t a b l e ( fumar )
fumar
chisq . t e s t ( fumar )

Y obtenemos:

38
3.8. Prueba de media
Estaprueba se utiliza para probar una afirmación con respecto a la media de una población úni-
ca. En vez de estimar el valor de un parámetro, en ocasiones se debe decidir si una afirmación
relativa a un parámetro es verdadera o falsa, en cuyo caso vamos a usar la prueba t que se utiliza
cuando deseamos comparar dos medias (las cuentas se deben medir en una escala de intervalo
o de cociente). Vamos realizarlo en R de una prueba T.

s e t . seed ( 1 0 )
x1 <− rnorm(100 ,10)
x2 <− rnorm ( 1 0 0 , 1 0 . 5 )
t e s t <− t . t e s t ( x1 , x2 )
print ( test )

Y obtenemos

Como el p-value es < 0.05 podemos afirmar que las muestras difieren en su media, es decir, las
dos variables son diferentes. Con un gráfico de cajas se puede ayudar a interpretar este resultado,
las medias se indican mediante un punto azul:

boxplot ( x1 , x2 , names=c ( " X1 " , " X2 " ) )


medias <− c (mean( x1 ) ,mean( x2 ) )
points ( medias , pch=18 , col ="blue " )

y se obtiene

39
40

También podría gustarte