0% acharam este documento útil (0 voto)
4 visualizações10 páginas

Estatísticas Descritivas com R: Aula 08

Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
4 visualizações10 páginas

Estatísticas Descritivas com R: Aula 08

Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

01/02/2024, 15:46 Notas de ESPR: Aula 08

Notas de ESPR: Aula 08


AUTHOR
João Paulo

Planejamento da Aula 08

Atividades
preparatórias para o
Estratégias aluno (antes do início
Aula Objetivo(s) Operacionalizado(s) Assunto Didáticas da aula)

8 Analisar medidas estatísticas Estatística descritiva: Aula expositiva Leitura das Notas de
descritivas adicionais com o R: comandos do R para dialogada e aula. Instalação dos
os pacotes Rmisc e psych. estatísticas descritivas de resolução de pacotes Rmisc e psych.
tendência central, posição e exercícios em sala.
dispersão.

Alguns pacotes para estatísticas descritivas no R


Os pacotes utilizados aqui suportam uma variedade de análises estatísticas muito mais complexas do
que vamos utilizar.

Exemplo 01: Estatísticas descritivas para dados em escala intervalo


ou razão.

Foco nas discussões e comandos.

Leitura dos dados em forma direta

Data = [Link](header=TRUE, stringsAsFactors=TRUE, text="


Grupo Location Altura
Grupo1 North 175
Grupo1 North 162
Grupo1 North 178
Grupo1 North 168
Grupo1 South 165
Grupo1 South 172
Grupo1 South 180
Grupo1 South 168
Grupo2 North 160
Grupo2 North 172
Grupo2 North 168
Grupo2 North 175
Grupo2 South 178
Grupo2 South 168
Grupo2 South 185
Grupo2 South 171
")

localhost:4834 1/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

Detalhamento

str(Data) ### Shows the structure of the data frame

'[Link]': 16 obs. of 3 variables:


$ Grupo : Factor w/ 2 levels "Grupo1","Grupo2": 1 1 1 1 1 1 1 1 2 2 ...
$ Location: Factor w/ 2 levels "North","South": 1 1 1 1 2 2 2 2 1 1 ...
$ Altura : int 175 162 178 168 165 172 180 168 160 172 ...

summary(Data) ### Summarizes variables in the data frame

Grupo Location Altura


Grupo1:8 North:8 Min. :160.0
Grupo2:8 South:8 1st Qu.:168.0
Median :171.5
Mean :171.6
3rd Qu.:175.8
Max. :185.0

Pacote Psych
if(!require(psych)){[Link]("psych")}

describe(Data$Altura)

vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 16 171.56 6.72 171.5 171.43 5.19 160 185 25 0.16 -0.85 1.68

A função describe() no pacote psych fornece estatísticas descritivas para um conjunto de variáveis.
As seguintes são as definições das variáveis na saída do describe() :

vars : O número de variáveis no conjunto de dados.


n : O número de observações no conjunto de dados.
mean : A média da variável.
sd : O desvio padrão da variável.
median : A mediana da variável.
trimmed : A média aparada, que é a média da variável após a remoção dos 10% superior e inferior
das observações.
mad : A mediana da diferença absoluta, que é uma medida robusta de variância que não é afetada
por outliers.
min : O valor mínimo da variável.
max : O valor máximo da variável.
range : O intervalo da variável, que é a diferença entre os valores máximo e mínimo.
skew : O enviesamento da variável. O enviesamento mede a assimetria da distribuição da variável.
Um enviesamento positivo indica que a distribuição tem uma cauda longa para a direita, enquanto
um enviesamento negativo indica que a distribuição tem uma cauda longa para a esquerda.

localhost:4834 2/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

Tipos de assimetria.

Fisher-Pearson coefficient of skewness


([Link]

g1 = 0 : há simetria
g1 ≈ 0 : pouca assimetria
g1 > 0 : assimetria à direita
g1 < 0 : assimetria à esquerda

library(psych)

describe(Notas)

localhost:4834 3/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 1000 9.05 0.99 9.34 9.23 0.67 1.92 10 8.08 -2.32 8.15 0.03

describe(Notas2)

vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 1000 6.96 0.91 6.68 6.82 0.71 6 12.51 6.51 1.63 3.48 0.03

describe(rnorm(1000,mean=8,sd=std))

vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 1000 7.99 0.76 8 7.99 0.73 5.72 10.44 4.72 -0.03 0.04 0.02
kurtosis : A curtose da variável. A curtose mede a achatamento da distribuição da variável.

Curtose: Fonte: [Link]

se g 2 = 0: curva normal
se g 2 ≈ 0: curva aproximadamente normal
se g 2 >> 0 : curva leptocurtica (alongada em relação à curva normal)
se g 2 << 0 : curva mesocurtica (achatada em relação à curva normal)

localhost:4834 4/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 10000 8 0.75 8 8 0.75 5.35 10.86 5.51 0.01 0 0.01

vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 10000 7.99 0.6 7.99 7.99 0.61 5.76 10.14 4.38 0.01 -0.03 0.01

vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 10000 8 0.5 8.01 8 0.5 5.9 10.05 4.15 -0.03 0.1 0.01

[1] "vars" "n" "mean" "sd" "median" "trimmed"


[7] "mad" "min" "max" "range" "skew" "kurtosis"
[13] "se"

se : O erro padrão da média, é uma medida de quanto a média da variável pode variar de amostra
para amostra.
s
se =
√n

Sumário de cinco pontos (Rcore)

summary(Data$Altura)

Min. 1st Qu. Median Mean 3rd Qu. Max.


160 168 172 172 176 185

Estatísticas para dados agrupados


Escala razão ou intervalar com pacotes R.

Pacote Rmisc
localhost:4834 5/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

library(Rmisc)

summarySE(data=Data,
"Altura",
groupvars="Grupo",
[Link] = 0.95)

Grupo N Altura sd se ci
1 Grupo1 8 171.00 6.3471 2.244 5.3063
2 Grupo2 8 172.12 7.4726 2.642 6.2472

summarySE(data=Data,
"Altura",
groupvars = c("Grupo", "Location"),
[Link] = 0.95)

Grupo Location N Altura sd se ci


1 Grupo1 North 4 170.75 7.1822 3.5911 11.428
2 Grupo1 South 4 171.25 6.5000 3.2500 10.343
3 Grupo2 North 4 168.75 6.5000 3.2500 10.343
4 Grupo2 South 4 175.50 7.5939 3.7969 12.084

Pacote Psych
Estatísticas descritivas agrupadas por Grupo

library(psych)

describeBy(Data$Altura,
group = Data$Grupo,
digits= 4)

Descriptive statistics by group


group: Grupo1
vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 8 171 6.35 170 171 7.41 162 180 18 0.07 -1.67 2.24
------------------------------------------------------------
group: Grupo2
vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 8 172.12 7.47 171.5 172.12 5.19 160 185 25 0.13 -0.96 2.64

Histograma agrupado por Grupo

# Criar o gráfico de caixa (boxplot)


boxplot(Altura ~ Grupo, data=Data, ylab="Altura(cm)", col="lightblue",las=2)

localhost:4834 6/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

Estatísticas descritivas para agrupamentos por Grupo e Location. Cada combinação resulta em uma
linha de estatísticas descritivas.

describeBy(Data$Altura,
group = Data$Grupo:Data$Location,
digits= 4)

Descriptive statistics by group


group: Grupo1:North
vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 4 170.75 7.18 171.5 170.75 7.41 162 178 16 -0.16 -2.15 3.59
------------------------------------------------------------
group: Grupo1:South
vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 4 171.25 6.5 170 171.25 5.19 165 180 15 0.36 -1.95 3.25
------------------------------------------------------------
group: Grupo2:North
vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 4 168.75 6.5 170 168.75 5.19 160 175 15 -0.36 -1.95 3.25
------------------------------------------------------------
group: Grupo2:South
vars n mean sd median trimmed mad min max range skew kurtosis se
X1 1 4 175.5 7.59 174.5 175.5 7.41 168 185 17 0.21 -2.12 3.8

Histograma agrupado por Grupo

boxplot(Altura~ Grupo+Location,
data=Data, ylab="Altura (cm)",col="lightblue",las=2)

localhost:4834 7/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

Elementos Essenciais

1. Como os dados podem ser inseridos diretamente no R utilizando a tabela de dados?

Resposta: Os dados são lidos diretamente usando o comando [Link] no ambiente R. A estrutura
dos dados é especificada usando o argumento header=TRUE , e a variável Altura é incluída como parte
do conjunto de dados.

2. Quais são as estatísticas descritivas fornecidas pela função describe do pacote psych ?

Resposta: A função describe do pacote psych fornece as seguintes estatísticas descritivas para uma
variável:

vars : Número de variáveis no conjunto de dados.


n : Número de observações no conjunto de dados.
mean : Média da variável.
sd : Desvio padrão da variável.
median : Mediana da variável.
trimmed : Média aparada (média após a remoção dos 10% superior e inferior das observações).
mad : Mediana da diferença absoluta (medida robusta de variância não afetada por outliers).
min : Valor mínimo da variável.
max : Valor máximo da variável.
range : Intervalo da variável (diferença entre valores máximo e mínimo).
skew : Enviesamento da variável (assimetria da distribuição).
kurtosis : Curtose da variável (achatamento da distribuição).

3. Como é calculado o erro padrão da média (s )?e

Resposta: O erro padrão da média (s ) é calculado pela fórmula: s


e e
=
s

√n
, em que s é o desvio padrão da
variável e n é o número de observações.

localhost:4834 8/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

4. O que é o coeficiente de assimetria ?

Resposta: O coeficiente de assimetria de Fisher-Pearson (g ) mede a assimetria da distribuição da


1

variável. Os diferentes valores de g indicam diferentes características de assimetria: - g


1 1 : Simetria.
= 0

-g 1 ≈ 0: Pouca assimetria. - g
1 > 0 : Assimetria à direita. - g 1 : Assimetria à esquerda.
< 0

5. O que é a curtose e como ela é interpretada?

Resposta: A curtose mede o achatamento da distribuição da variável. Diferentes valores de curtose (g ) 2

indicam diferentes características da distribuição: - g 2 : Curva normal. - g


= 0 2 : Curva
≈ 0

aproximadamente normal. - g 2 : Curva leptocurtica (alongada em relação à curva normal). - g


> 0 2 :
< 0

Curva mesocurtica (achatada em relação à curva normal).

6. Qual é a resultante do comando summarySE do pacote Rmisc ?

Resposta: A função summarySE do pacote Rmisc fornece estatísticas descritivas agrupadas por uma ou
mais variáveis de grupo. Ela também pode calcular intervalos de confiança.

7. ** Como é criado um histograma agrupado por Grupo usando o pacote Psych ?**

Resposta: Um histograma agrupado por Grupo é criado usando o comando boxplot(Altura ~ Grupo,
data=Data, ylab="Altura(cm)", col="lightblue", las=2) .

8. Como é possível criar um histograma agrupado por combinações de Grupo e Location usando o
pacote Psych ?

Resposta: Um histograma agrupado por combinações de Grupo e Location é criado usando o


comando boxplot(Altura ~ Grupo+Location, data=Data, ylab="Altura (cm)",
col="lightblue", las=2) .

Exercícios
Considere os dados disponíveis no link a seguir:

students <- [Link]("[Link]

1. Faça resumo estatístico das variáveis quantitativas.


2. Faça um resumo estatístico das variáveis qualitativas.
3. Aplique o comando describe (do pacote psych) aos dados students. Avalie os resultados e
argumente para quais tipos de dados os resultados são corretamente mostrados. A seguir os
comandos:

4. Quais tipos de variáveis podem ser utilizadas ao fazer um resumo estatístico com o comando
describeBy(x,group=grupos), ou seja, quais x deve ter quais tipos de dados (e respectivas escalas) e
grupos deve ter quais tipos de dados (e respectivas escalas).

5. Faça um resumo das alturas dos alunos de students de acordo com a religião.
6. Faça um boxplot das alturas dos alunos de students de acordo com a religião.
7. Explique cada um dos elementos resultantes do comando describe() do pacote psych, ou seja,
detalhe o que são cada um dos elementos “vars”, “n”, “mean”, “sd”, “median”, “trimmed”, “mad”,

localhost:4834 9/10
01/02/2024, 15:46 Notas de ESPR: Aula 08

“min”, “max”, “range”, “skew”, “kurtosis”, “se”.

localhost:4834 10/10

Você também pode gostar