0% acharam este documento útil (0 voto)
5 visualizações145 páginas

Estatística Clássica no RStudio

O documento é um rascunho sobre Estatística Clássica no RStudio, abordando conceitos fundamentais como variáveis, estatísticas descritivas, medidas de posição e dispersão, além de visualizações e teoria da probabilidade. Ele é estruturado em seções detalhadas, cada uma cobrindo tópicos específicos com exemplos práticos. O autor, Filipe J. Zabala, apresenta uma abordagem didática para facilitar a compreensão dos conceitos estatísticos.

Enviado por

Skrol Salustiano
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
5 visualizações145 páginas

Estatística Clássica no RStudio

O documento é um rascunho sobre Estatística Clássica no RStudio, abordando conceitos fundamentais como variáveis, estatísticas descritivas, medidas de posição e dispersão, além de visualizações e teoria da probabilidade. Ele é estruturado em seções detalhadas, cada uma cobrindo tópicos específicos com exemplos práticos. O autor, Filipe J. Zabala, apresenta uma abordagem didática para facilitar a compreensão dos conceitos estatísticos.

Enviado por

Skrol Salustiano
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

DRAFT VERSION

HEstatı́stica ClássicaI
no RStudio

Filipe J. Zabala
PUCRS
[Link]@[Link]

2017-08-02

“ Fazendo umas médias se faz uma média.”


∼ Filipe Zabala, 2017

Sumário

1 Introdução e Notação 4
1.1 Algarismos e Números . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
1.2 Porcentagens, Decimais e Milhares . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
1.3 O Senhor X . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
1.4 Somatório . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
1.5 Arredondamento e Truncagem . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
1.6 Outros sı́mbolos e expressões . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
1.7 Momentinho Cultural . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8

2 Estatı́stica Descritiva 9
2.1 Variáveis . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
2.1.1 Variável qualitativa nominal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
2.1.2 Variável qualitativa ordinal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.1.3 Variável quantitativa discreta . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.1.4 Variável quantitativa contı́nua . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.2 Distribuição de Frequência . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
2.2.1 Dados brutos, Rol e Estatı́sticas de Ordem . . . . . . . . . . . . . . . . . . . . . . 12
2.2.2 Tabela de frequência univariada discreta . . . . . . . . . . . . . . . . . . . . . . . . 13
2.2.3 Tabela de frequência univariada contı́nua . . . . . . . . . . . . . . . . . . . . . . . 16
2.2.4 Tabela (de frequência) bivariada . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
2.3 Medidas de Posição (ou Localização) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.3.1 Mı́nimo e Máximo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.3.2 Média (Aritmética Simples) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
2.3.3 Total . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
2.3.4 Média (Aritmética) Ponderada . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
2.3.5 Média Geométrica . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
2.3.6 Média Harmônica . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
2.3.7 Média Quadrática . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
2.3.8 Moda . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
2.3.9 Separatrizes (ou Quantis) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28

1
DRAFT VERSION
2.4 Medidas de Dispersão (ou Variabilidade) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
2.4.1 Amplitude . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
2.4.2 Variância . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
2.4.3 Desvio Padrão . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32
2.4.4 Coeficiente de Variação . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33
2.5 Outras medidas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
2.5.1 Assimetria (ou Obliquidade) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
2.5.2 Curtose . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
2.6 Visualização . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
2.6.1 Gráfico de Setores (Pizza) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
2.6.2 Gráfico de Barras e Colunas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 41
2.6.3 Histograma . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
2.6.4 Box plot . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
2.6.5 Gráfico de Dispersão . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 44

3 Probabilidade 46
3.1 Teoria dos Conjuntos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
3.1.1 Relações . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
3.1.2 Conjunto Vazio . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
3.1.3 Cardinal e Conjunto das Partes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
3.1.4 Operações . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48
3.1.5 Conjuntos Disjuntos e Partição . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
3.2 Definições . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
3.2.1 Experimento Aleatório . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
3.2.2 Espaço Amostral . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
3.2.3 Evento . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
3.2.4 Probabilidade . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
3.2.5 Propriedades . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 51
3.2.6 Probabilidade Condicional . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 52
3.2.7 Teorema da Probabilidade Total e a Regra de Bayes . . . . . . . . . . . . . . . . . 53
3.3 Variáveis Aleatórias Discretas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
3.3.1 Esperança e Variância . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
3.3.2 Distribuições de probabilidade . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55
3.3.3 Distribuição Binomial B(n, p) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55
3.3.4 Distribuição Binomial Negativa BN (k, p) . . . . . . . . . . . . . . . . . . . . . . . 56
3.3.5 Distribuição Poisson P(λ) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
3.4 Variáveis Aleatórias Contı́nuas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
3.4.1 Esperança e Variância . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
3.4.2 Distribuição Normal N (µ, σ 2 ) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
3.4.3 Teorema Central do Limite . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61
3.4.4 Distribuição Qui-quadrado χ2 (ν) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
3.4.5 Distribuição t (de Student) t(ν) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
3.4.6 Distribuição F (de Fisher-Snedecor) F(ν1 , ν2 ) . . . . . . . . . . . . . . . . . . . . . 64
3.4.7 Distribuição Exponencial E(λ) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 64

4 Inferência Estatı́stica Clássica 70


4.1 Universo e Amostra . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 71
4.1.1 N e n . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 71
4.1.2 Cálculo do tamanho da amostra . . . . . . . . . . . . . . . . . . . . . . . . . . . . 72
4.2 Amostragem . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 72
4.2.1 Conceitos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 73
4.2.2 Amostragem Aleatória Simples (AAS) . . . . . . . . . . . . . . . . . . . . . . . . . 74
4.2.3 Amostragem Estratificada (AE) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 75
4.2.4 Amostragem por Conglomerados (AC) . . . . . . . . . . . . . . . . . . . . . . . . . 75
4.2.5 Amostragem Sistemática (AS) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
4.2.6 Amostragem por Cotas (ACot) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
4.3 Estimação Pontual . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76

Page 2
DRAFT VERSION
4.3.1 Proporção ou Percentual . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
4.3.2 Média . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 77
4.3.3 Variância e Desvio Padrão . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 77
4.4 (Estimação por) Intervalo de Confiança . . . . . . . . . . . . . . . . . . . . . . . . . . . . 77
4.4.1 Proporção . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 78
4.4.2 Média com σ conhecido . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 78
4.4.3 Média com σ desconhecido . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 79
4.4.4 Variância . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 80
4.4.5 Desvio Padrão . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 80
4.5 (Estimação por) Teste de Hipóteses . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81
4.5.1 Equivalência entre Testes de Hipóteses e Intervalos de Confiança . . . . . . . . . . 81
4.5.2 Hipóteses . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82
4.5.3 Estatı́stica do Teste - Univariada . . . . . . . . . . . . . . . . . . . . . . . . . . . . 83
4.5.4 Valor-p (p-value) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 85
4.5.5 Valor Crı́tico . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 86
4.5.6 Estatı́stica do Teste - Bivariada . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 88

5 Modelos Lineares 94
5.1 Correlação . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 94
5.1.1 ρ, a correlação universal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 94
5.1.2 r, (coeficiente de) correlação (amostral) (de Pearson) . . . . . . . . . . . . . . . . . 96
5.1.3 Teste para ρ . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 97
5.1.4 ρRP O e rRP O , a correlação na Regressão Pela Origem . . . . . . . . . . . . . . . . 98
5.2 Regressão Linear Simples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 98
5.2.1 Equação da reta de regressão . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 99
5.2.2 Análise de diagnóstico . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 101
5.3 Regressão Logı́stica . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107
5.3.1 Bivariada . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107
5.3.2 Multivariada Nominal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107

6 Números Índice 113


6.1 Índices Relativos ou Simples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
6.1.1 de Preço . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
6.1.2 de Quantidade . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
6.1.3 de Valor . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
6.2 Índices Agregativos Simples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 115
6.2.1 Índice Agregativo Simples (de Bradstreet) . . . . . . . . . . . . . . . . . . . . . . . 115
6.2.2 Índice Médio Aritmético (de Sauerbeck) . . . . . . . . . . . . . . . . . . . . . . . . 115
6.3 Índices Agregativos Ponderados . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 116
6.3.1 Índice (Ponderado) de Laspeyres ou da época base . . . . . . . . . . . . . . . . . . 116
6.3.2 Índice (Ponderado) de Paasche ou da época atual . . . . . . . . . . . . . . . . . . . 116
6.3.3 Índice (Ponderado) de (Irving) Fisher . . . . . . . . . . . . . . . . . . . . . . . . . 117

7 Séries Temporais 119

A Tabelas 120

B Respostas dos Exercı́cios (interminatus) 128

C Uma breve introdução ao R e RStudio 139

D Equação da Reta 142

Page 3
DRAFT VERSION

“ Antes de ler o livro que o guru lhe deu


você tem que escrever o seu.”
∼ Raul Seixas, 1979

1 Introdução e Notação
á dois motivos para ler este texto: (i) você deseja se tornar um profissional qualificado e entende
H que o ferramental estatı́stico pode auxiliar em suas decisões futuras ou (ii) você foi obrigado. De
toda forma sugere-se a leitura deste e de outros materiais de apoio ao longo do curso1 , praticando através
de exercı́cios de fixação2 . Leia este livro / É uma pesquisa paciente / Cada linha desse texto / No papel ou
virtualmente / Fará você ficar / Ao menos inteligente3 . Este texto consiste em declarações tão verı́dicas
quanto o possı́vel para a linguagem humana usual.
O Método Estatı́stico ou simplesmente Estatı́stica reúne ferramentas teóricas e práticas para analisar
informações quantitativas, medir incertezas e auxiliar na tomada de decisão. É um componente do
Método Cientı́fico, e pode ser dividido conforme o esquema da Figura 1.1.
Estatı́stica
.&
Descritiva Inferencial
.&
HClássicaI Bayesiana

Figura 1.1: Uma possı́vel divisão da Estatı́stica

Neste curso serão abordados tópicos de Estatı́stica Descritiva, Probabilidade, Inferência Estatı́stica
sob o prisma da Estatı́stica Clássica (ou Frequentista), Modelos Lineares e Números Índice.

1.1 Algarismos e Números


Um algarismo é um sı́mbolo, enquanto um número expressa uma idéia4 de quantidade. Números são
representados por algarismos, sendo fundamental distinguir estes elementos.
Se há 20 alunos na sala A outros 30 na sala B, pode-se dizer que, em média, há 20+30
2 = 25 alunos nas
duas salas. Esta é uma informação numérica. Se rotularmos o sexo masculino como 0 e o feminino como
1, fica claro que 0 e 1 estão sendo tratados como algarismos, uma vez que não expressam quantidades.

1.2 Porcentagens, Decimais e Milhares


Neste texto será adotado o padrão americano, que utiliza o sı́mbolo de ponto (.) como separador de
decimais e vı́rgula (,) como separador de milhares. Assim,
1 2.5
= 0.025 = 0.0250 = .025 = 2.5% = .
40 100
Dı́zimas periódicas serão escritas na forma 13 = 0.333... = 0.3̄ ≈ 0.333 ≈ 0.3. O número 32, 960 =
30, 000 + 2, 000 + 960 deve ser lido como ‘trinta e dois mil novecentos e sessenta’.
Esta opção evita muitos problemas, já que muitos softwares estatı́sticos não são compatı́veis com o
padrão brasileiro, que utiliza vı́rgula como separador de decimais e ponto para separar os milhares. Nas
anotações pessoais e listas de exercı́cios poderá ser adotada a notação de preferência do aluno.
1 Este material foi desenvolvido nos ambientes RStudio 1.0.153 e R 3.4.1.
2 [Link]
3“Compre este disco / É uma pesquisa paciente / Cada volta da agulha / Pelo sulco docemente / Fará você ficar / Mais

feliz e inteligente”. ‘Jingle do Disco’ de Tom Zé, do álbum 1992 The Hips of Tradition.
4 Neste texto as idéias têm acento.

Page 4
DRAFT VERSION
1.3 O Senhor X
Quando avalia-se algo de interesse prático, em geral observam-se nomes longos. Considere a variável
X: número de filhos de mulheres atendidas em um hospital público de Porto Alegre em 2012.
Esta longa descrição tornará maçante qualquer texto que utilize-o muitas vezes, tornando impraticável
a realização de cálculos envolvendo tal caracterı́stica de interesse. É razoável, portanto, associar descrições
longas a sı́mbolos. A letra X é famosa por simbolizar algo genérico, tanto na Ciência quanto na vida
cotidiana. Note que o sı́mbolo utilizado para separar X de sua descrição é ‘ : ’, e não ‘ = ’, como
erroneamente se utiliza em certos casos.
Neste texto será utilizado X (maiúsculo) para representar a caracterı́stica de interesse, e xk (minús-
culo) para representar o k-ésimo valor observado desta caracterı́stica. Assim, enquanto X representa
genericamente o número de filhos de mulheres atendidas em um hospital público de Porto Alegre em
2012, x4 = 2 indica que a quarta mulher avaliada no estudo tem dois filhos.

1.4 Somatório
Pn
A soma de n números x1 , x2 , ..., xn é representada por i=1 xi = x1 + x2 + · · · + xn , e lê-se ‘somatório
de xis i de um até ene’.
Exemplo 1.1. (Número de passos) Suponha que foi anotado o ‘número de passos até a lixeira mais
próxima’ na cidade de Porto Alegre em n = 6 ocasiões, conforme Tabela 1.1.

x1 x2 x3 x4 x5 x6
186 402 191 20 7 124

Tabela 1.1: Número de passos até a lixeira mais próxima na capital gaúcha

Esta tabela indica que na primeira ocasião foram caminhados 186 passos até localizar uma lixeira
(representado por x1 = 186), na segunda foram 402 passos (representado por x2 = 402), e assim suces-
sivamente. Para calcular o total de passos caminhados, pode-se fazer
6
X
xi = x1 + x2 + · · · + x6 = 186 + 402 + 191 + 20 + 7 + 124 = 930 (1)
i=1

> 186+402+191+20+7+124 # R e RStudio s~


ao calculadoras (Ap^
endice C)

[1] 930

> x <- c(186,402,191,20,7,124) # Pode-se criar um vetor e atribuir a x


> sum(x) ao 'sum', apresentada na Equaç~
# Usando a funç~ ao (1)

[1] 930

> sum(x^2) # Soma dos quadrados, representada pela Equaç~


ao (2)

[1] 248506

, P
A letra grega é o sigma P
maiúsculo,
P P conforme Tabela 1.3. Em muitos casos a simbologia de somatório
é simplificada, utilizando-se , x e i . A seguir estão alguns exemplos de uso mais sofisticado do
somatório, podendo ser omitidos em uma primeira leitura5 .
N
X
x2i = x21 + x22 + . . . + x2N (2)
i=1

N
X N
X
(xi − µ)2 = (x1 − µ)2 + (x2 − µ)2 + . . . + (xN − µ)2 = (xi − x̄n )2 + n(x̄n − µ)2 (3)
i=1 i=1
5 Notação utilizada no cálculo de variâncias, detalhado na Seção 2.4.2.

Page 5
DRAFT VERSION
1.5 Arredondamento e Truncagem
Arredondamento 6 e truncagem são métodos para escrever números com precisão delimitada.
Para arredondar um número para a k-ésima casa decimal, basta observar a k+1-ésima casa. Se a k+1-
ésima casa decimal for 0, 1, 2, 3 ou 4, mantém-se a k-ésima casa decimal; se a k+1-ésima casa decimal for
5, 6, 7, 8 ou 9, soma-se 1 à k-ésima casa decimal. Como exercı́cio, releia a frase anterior substituindo ‘k-
ésima’ por ‘quarta’ e ‘k+1-ésima’ por ‘quinta’, aplicando esta regra para o número 153.654321. Note que
deve-se sempre avaliar o número original para realizar o arredondamento. Arredondamentos
são comuns, por exemplo, ao calcularmos um ı́ndice de preço ou um montante de pagamento sobre o
qual incidiu certa taxa de juros.
Para truncar um número para a k-ésima casa decimal, basta eliminar a k+1-ésima casa decimal e
suas subsequentes. Como exercı́cio, releia a frase anterior substituindo ‘k-ésima’ por ‘quarta’ e ‘k+1-
ésima’ por ‘quinta’, aplicando esta regra novamente para o número 153.654321. Compare com os valores
arredondados e note que pode-se utilizar números já truncados para continuar a reduzir a precisão sem a
necessidade de conhecer o valor original. Truncagens são comuns, por exemplo, para representar idades
e ao calcular os graus G1 e G2 da PUCRS. Assim, se o cálculo do seu G1 resultar em 6.99999999, o
sistema irá truncar para 6.9, e não arredondar para 7.0.
Exemplo 1.2. (Arredondamento e truncagem)

Decimais Arredondamento Truncagem


6 153.654321 153.654321
5 153.65432 153.65432
4 153.6543 153.6543
3 153.654 153.654
2 153.65 153.65
1 153.7 153.6
0 154 153
−1 150 150
−2 200 100

Tabela 1.2: Arredondamento e truncagem do número 153.654321

> options(digits = 10) # Ajustando para apresentaç~


ao de 10 dı́gitos (padr~
ao: 7)
> for(i in 6:-2){ print(round(153.654321, digits = i)) } # 'digits' casas decimais

[1] 153.654321
[1] 153.65432
[1] 153.6543
[1] 153.654
[1] 153.65
[1] 153.7
[1] 154
[1] 150
[1] 200

> trunc <- function(x, ..., prec = 0) base::trunc(x*10^prec, ...)/10^prec # Aprimorando


> for(i in c(6:-2)){ print(trunc(153.654321, prec = i)) } # Precis~
ao de i decimais

[1] 153.654321
[1] 153.65432
[1] 153.6543
[1] 153.654
[1] 153.65
[1] 153.6
[1] 153
[1] 150
[1] 100

6 Esta é a regra do arredondamento para o número mais próximo.

Page 6
DRAFT VERSION
> # [Link]('plyr', dep = T) # Utilizando round_any do pacote plyr
> plyr::round_any(153.654321, .01, round) # digits = 2 em round

[1] 153.65

> plyr::round_any(153.654321, .0001, floor) # prec = 4 em trunc

[1] 153.6543

> plyr::round_any(153.654321, 1, round) # digits = 0 em round

[1] 154

> plyr::round_any(153.654321, 100, round) # digits = -2 em round

[1] 200

1.6 Outros sı́mbolos e expressões


• ∼: tem distribuição.
• ≈: aproximadamente.
• #: número de.
• ⊥
⊥: é independente de.
• ±/∓: mais ou menos/menos ou mais.
• ,: fim do Exemplo.
• : fim do Teorema.
a

• ˇ “( : fim do Momentinho Cultural.


• i.e.: id est, expressão em Latim que significa ‘isto é’.
• e.g.: exempli gratia, expressão em Latim que significa ‘por exemplo’.

Maiúscula Minúscula Nome Maiúscula Minúscula Nome


A α Alfa N ν Nü
B β Beta Ξ ξ Csi
Γ γ Gama O o Ômicron
∆ δ Delta Π π, $ Pi
E , ε Épsilon P ρ, % Rô
Z ζ Zeta Σ σ, ς Sigma
H η Eta T τ Tau
Θ θ, ϑ Teta Υ υ Úpsilon
I ι Iota Φ φ, ϕ Fi
K κ, κ Capa X χ Qui
Λ λ Lambda Ψ ψ Psi
M µ Mü Ω ω Ômega

Tabela 1.3: Sim, estamos falando grego.

Page 7
DRAFT VERSION
1.7 Momentinho Cultural
Sabe-se que a atenção do ser humano é limitada. O limiar de atenção – tempo que uma pessoa consegue
ficar focada em determinada tarefa – gira em torno de 40 minutos para tarefas do cotidiano7 . Assim, em
um esforço para dar um maior dinamismo às aulas, foi criado o Momentinho Cultural. É uma pausa com
tempo determinado arbitrariamente pelo professor, com a função principal de descontrair o ambiente.
Tal arbitrariedade fornece ao professor autonomia para não realizar o MC, se assim julgar necessário.
‘Momentinho’ sugere uma pausa breve, enquanto ‘Cultural’ tem como objetivo nortear a discussão
livre para assuntos mais elevados. Os temas abordados com maior frequência são Música, Teatro, Cinema
e Atualidades. Note as intervenções intituladas ‘Momentinho Cultural’ ao longo deste material, que se
valem dos benefı́cios da aplicação do método8 :

• relaxa;
• é divertido;
• estimula a comunicação entre os alunos e o professor;
• cria um ambiente para discussão de questões fundamentais que não encontram espaço no currı́culo
formal.

Mas justiça seja feita aos mestres que já se utilizavam desta técnica, que foi transmitida ao autor
pelo grande João Beal Vargas durante suas magnéticas aulas. O professor, maratonista, poeta e gaitero
Chico Silveira costumava aplicar seu MC, o ‘Momento do Chico’. Curiosamente outro sábio professor –
o sempre alegre José Baratojo – nos ensina sobre esta arte, intitulada ‘zunzun’ em seu conto ‘Psicologia
das cores’9 , transcrito abaixo.

Psicologia das cores

Alguns anos atrás recebi uma turma de alunos (47 alunas e 3 alunos) do Curso de Psi-
cologia. Como podem imaginar, a parte da aula mais difı́cil não era referente aos assuntos
da Matemática que eu devia ministrar-lhes, mas sim, fazer com que as alunas conseguissem
parar de conversar.
Em primeiro lugar, entrei num acordo com aquele simpático e educado grupo, acordo esse
que consistia em fazer de tempos em tempos, após a explicação de algum assunto, um mo-
mento que intitulamos de “zunzun”. Desse modo, fomos até o fim do semestre bem entrosados.
Como a turma era numerosa, resolvi, no primeiro trabalho de verificação da aprendizagem,
organizar quatro provas diferentes e, para que pudesse identificá-las de longe, eu as fiz em
papel com cores diferentes: amarelo, verde, rosa e branco.
Os alunos verificaram logo que havia quatro provas diferentes e trataram cada um de
resolver a sua, pois não dava para conferir com a dos seus vizinhos.
No segundo trabalho, eu resolvi fazer somente duas provas diferentes, mas distribuı́ aquelas
provas também em papel com quatro cores diferentes.
Quando eles viram as cores, baixaram a cabeça e começaram a trabalhar, tranquilamente.
No terceiro e último trabalho, eu fiz uma única prova e continuei usando as quatro cores
e o trabalho também foi realizado numa grande tranquilidade.
Ao término do último trabalho, eles perceberam comparando as questões que haviam resol-
vido, que todos tinham a mesma prova e, então, vieram me perguntar: “Professor! Só existia
uma única prova?” Eu lhes respondi afirmativamente.
“Então por que o senhor usou as quatro cores diferentes?”
Aı́ eu lhes disse: Eu usei as quatro cores por três grandes motivos: 1 º) para que vocês
pensassem que eram quatro provas diferentes, o que vocês realmente pensaram; 2 º) para que
vocês, pensando dessa forma, realizassem a prova tranquilamente, sem se preocuparem com
os vizinhos, o que aconteceu também; 3 º) para que os alunos da psicologia vissem a influência
das cores no comportamento humano!

∼ José Baratojo, 2000

7 Dukette and Cornish (2009)


8 Dica:busque por ‘momentinho cultural’ no Google.
9 Baratojo (2000).

Page 8
DRAFT VERSION

“ O pensamento estatı́stico será um dia tão necessário para a cidadania


quanto a habilidade de ler e escrever.”
∼ James W. Tankard Jr., 197910

2 Estatı́stica Descritiva
Estatı́stica Descritiva está diretamente ligada à organização e descrição dos dados. É utili-
A zada para avaliar como as observações se distribuem, onde estão posicionadas e como se apre-
sentam em termos de dispersão e associação. Neste capı́tulo serão introduzidos conceitos e métodos
descritivos, ponto de partida da análise exploratória de dados, passo fundamental para análises estatı́s-
ticas mais avançadas.

2.1 Variáveis
Variável é uma caracterı́stica medida nos universos ou amostras. As variáveis qualitativas ou atributos
avaliam caracterı́sticas não numéricas no conjunto de interesse, como gênereo, time de futebol e nı́vel
de escolaridade. As variáveis quantitativas medem caracterı́sticas numéricas, como número de alunos
prestando atenção ou tempo de uma música em segundos. Podem ser classificadas conforme a Figura
2.1.
Variável
. &
Qualitativa Quantitativa
.& .&
Nominal Ordinal Discreta Contı́nua

Figura 2.1: Uma possı́vel classificação das variáveis

2.1.1 Variável qualitativa nominal


Variáveis qualitativas nominais possuem o menor grau de informação dentre os quatro tipos propostos,
permitindo apenas a avaliação de frequências e ordenações arbitrárias. Aplicam-se em avaliações de
grupos não ordenados, tais como ‘gênero’, ‘religião’, ‘raça’, ‘cor preferida’, ‘bairro onde reside’, ‘time de
futebol do coração’, etc.
Exemplo 2.1. (Time de futebol do coração) Suponha um lugar onde tudo seja tratado de maneira
dicotômica11 . Como exercı́cio, no primeiro dia de aula de Estatı́stica as pessoas são questionadas quanto
ao ‘time de futebol do coração’ através do voto secreto em uma cédula, onde estão listados os dois times
locais. Não existe informação prévia que obrigue a dispor na listagem qualquer time antes ou depois de
outro. Por este motivo optou-se pela ordenação alfabética – apesar do princı́pio de tumulto –, resultando
na lista
Maragato F.C.
Ximango F.C.
Os mais tradicionalistas gritavam palavras de ordem, preferindo a grafia
Chimango F.C.
Maragato F.C.
,
10 [Link]
11 Dicotomia é o ato de segmentar um conjunto em dois subconjuntos mutuamente excludentes, i.e., um elemento pode

pertencer somente a um dos subconjuntos.

Page 9
DRAFT VERSION
2.1.2 Variável qualitativa ordinal
Variáveis qualitativas ordinais possuem grau de informação maior em relação às nominais pois são do-
tadas de uma ordenação prévia, permitindo comparações entre as observações. As variáveis de natureza
ordinal são utilizadas quando avaliam-se medidas tais como ‘colocação em um torneio esportivo’, ‘grau
de escolaridade’, ‘classificação de um restaurante quanto à qualidade da comida’, etc.
Exemplo 2.2. (Colocação no vestibular) A variável ‘colocação geral no vestibular’ é classificada como
qualitativa ordinal pois indica a ordenação do vestibulando em comparação aos demais, mesmo que não
se conheça a nota final de cada candidato.
,
Exemplo 2.3. (Escala de Likert) Quando deseja-se medir o grau de satisfação em relação a algum bem
ou serviço, pode-se utilizar a Escala de Likert de k nı́veis. Se um empresário utilizar k = 4, pode fazer
1: Ruim, 2: Regular, 3: Bom, 4: Ótimo. Se k = 5, pode-se considerar 1: Péssimo, 2: Ruim, 3: Regular,
4: Bom, 5: Ótimo.
A vantagem de utilizar k par é que obriga-se o respondente a se posicionar a favor/contra, acima/abaixo.
,
Exemplo 2.4. (Corrida maluca) Suponha uma corrida disputada em Imaginationland12 , na qual Ru-
binho Barrichello tenha chegado na primeira colocação e Ayrton Senna na décima nona. As únicas
informações de que dispomos apontam que i) Barrichello chegou antes de Senna, ii) ninguém chegou
antes de Barrichello, iii) há 17 intermediários e iv) de fato, tudo aconteceu em Imaginationland.
,

2.1.3 Variável quantitativa discreta


Hollywood nos presenteou com grandes herois13 , que tornam nossa vida mais emocionante, ainda que
muito distante da realidade. Stallone dizima exércitos apenas com sua faca, Angelina Jolie desafia as
leis da Fı́sica ao dar tiros em curva, Schwarzenegger torna-se governador da Califórnia. Mas ainda que
estas pessoas acumulem feitos incrı́veis, nenhum deles é capaz de dar um tiro e meio ou resgatar 74% da
mocinha.
Isso ocorre pois ‘número de tiros’ ou ‘número de mocinhas resgatadas’ são denominadas variáveis
quantitativas discretas, visto que assumem apenas valores inteiros (discretos). Tecnicamente as variáveis
discretas são caracterizadas por conjuntos enumeráveis14 finitos ou infinitos.
Exemplo 2.5. (Número de filhos) Suponha que deseja-se observar o número de filhos de mulheres
atendidas em um hospital. Para cada mulher entrevistada, o conjunto de possı́veis respostas para a
pergunta ‘quantos filhos a senhora tem?’ é F = {0, 1, 2, . . . , k}, onde k é o número máximo de filhos que
uma mulher possa ter ao longo de sua vida. O recorde mundial é k = 69, atribuı́do à russa Valentina
Vassilyeva. Este é um conjunto enumerável finito.
,
Exemplo 2.6. (Pontos em um dado lançado k vezes) Suponha k lançamentos de um dado. Em cada
lançamento é anotada a face resultante, somada aos valores obtidos nos k − 1 lançamentos anteriores.
O conjunto de possı́veis resultados deste experimento é S = {k, k + 1, . . . , 6k}. Este é um conjunto
enumerável finito. Como exercı́cio, faça k = 4 e releia a sentença anterior substituindo os valores.
,
Exemplo 2.7. (Consumo de uma engrenagem moto-contı́nua) Suponha uma engrenagem eterna, com
consumo medido em PAB15 . O conjunto do número possı́vel de passos é S = {1, 2, . . .}. Este é um
conjunto enumerável infinito.
/
Exemplo 2.8. (Pilcher’s Squad) Norman Pilcher foi o criador da Drug Squad, e ganhou notoriedade nos
anos 60 por prender artistas como Mick Jagger e John Lennon. O conjunto de artistas que o Sargento
Pilcher poderia prender é A = {a1 , a2 , . . . , ak }, onde k representa o número de artistas disponı́veis para
serem presos. Este é um conjunto enumerável finito.
,
12 [Link]
13 Aqui os herois não têm acento.
14 Um conjunto enumerável é aquele em que se pode listar e contar os elementos.
15 Passos Até a Bufunfa.

Page 10
DRAFT VERSION
2.1.4 Variável quantitativa contı́nua
A classe de variáveis quantitativas contı́nuas é caracterizada por permitir a observação de qualquer sub-
conjunto dos números reais como resultado, i.e., permite resultados não inteiros. É utilizada para avaliar
tempo, distâncias, áreas, volumes ou qualquer outra grandeza numérica de caráter não enumerável16 .
Tal como nas variáveis discretas, é possı́vel avaliar relações matemáticas entre os valores observados.
Exemplo 2.9. (Percentual de bulı́micas) Suponha que um grupo de pesquisadores está interessado em
avaliar o ‘percentual de mulheres bulı́micas no Rio Grande do Sul’. Este valor está obrigatoriamente entre
0 e 1 (ou 0% e 100%), podendo ser representado pelo conjunto não enumerável Ω = {b ∈ R : 0 ≤ b ≤ 1}.
,
Exemplo 2.10. (Idade) A variável ‘idade’ é classificada como quantitativa contı́nua por representar
uma noção temporal. Caso haja interesse, pode-se dizer que em certo instante do tempo João apresen-
tou 31.990192013071629871269817323644 anos de idade. Na prática, porém, geralmente as idades são
truncadas17 , sendo que João provavelmente afirmaria ter 31 anos de idade mesmo um dia antes do seu
32ºaniversário. Na melhor das situações as idades são observadas com precisão de dias, calculando-se a
idade do indivı́duo pela diferença entre o dia de hoje e o seu dia de nascimento, convertendo o valor para
anos. O conjunto dos possı́veis tempos de vida de um ser humano é dado por Ω = {t ∈ R : 0 < t ≤ T },
onde T é a idade máxima em anos que um ser humano pode atingir. Segundo o Guiness World Records,
T = 122.44931506849315, alcançado pela francesa Jeanne Louise Calment. Ω é dito não enumerável
visto não ser possı́vel contabilizar o seu número de elementos.
,
Exemplo 2.11. (Descendo o nı́vel) Suponha que um grupo de pessoas foi avaliado em relação à variável
‘idade’ medida em anos, considerando-se a hora e minuto do nascimento. É possı́vel transformá-la
na variável ‘idade discreta’ simplesmente truncando os valores observados. Da mesma forma, pode-se
tranformá-la na variável ‘idade ordinal’, classificando-a de acordo com a tabela a seguir.

i Faixa etária Classificação


1 Até 10 anos Criança
2 10 ` 13 Pré-adolescente
3 13 ` 18 Adolescente
4 18 ` 35 Adulto jovem
5 35 ` 45 Adulto
6 45 ` 65 Adulto maduro
7 65 ` 75 Idoso jovem
8 75 + Idoso

Note que se uma pessoa tem 31.990192013071629871269817323644 anos de idade (contı́nua), pode-
se considerar a idade truncada de 31 anos (discreta) e classificá-la como um ‘adulto jovem’ (ordinal).
Porém, dado que uma pessoa é classificada como adulto jovem, é possı́vel apenas afirmar que ela tem
idade entre 18 anos (completos) e 35 anos (incompletos) segundo a classificação proposta.
,
Cada tipo de variável apresenta um nı́vel de informação que deve ser respeitado. É possı́vel ir de
um nı́vel maior de classificação para um nı́vel menor, mas jamais ao contrário. É válido lembrar que
perde-se informação ao descer o nı́vel de classificação da variável. É bastante comum encontrar trabalhos
utilizando nı́veis de classificação inapropriados, conduzindo a técnicas não adequadas que implicam em
conclusões equivocadas. Verdade.

EXERCÍCIOS
1. Classifique as variáveis abaixo (qualitativa nominal/ordinal, quantitativa discreta/contı́nua).

a) Número de geladeiras em casa


b) Temperaturas da água da piscina em um dia de verão
c) Número de suicı́dios em uma cidade no decorrer do ano passado
16 Um conjunto não enumerável possui infinitos elementos, sendo impossı́vel listá-los segundo alguma regra.
17 Seção1.5.

Page 11
DRAFT VERSION
d) Concentração de chumbo em uma amostra de água
e) Lista de editoras de livros
f) Grau de satisfação dos clientes que frequentam uma rinha de galo
g) Marcas de amaciantes para roupas
h) Tempo que um paciente sobrevive após determinado diagnóstico
i) Participação de mercado (ou market share, para falar bonito)
j) Classificação em uma corrida de banheiras
k) Tempo final de cada corredor
l) Lista dos nomes das banheiras participantes, tal como “Dick Vigarista” e “Trollface”
m) Distância de Estambul ao Rio de Janeiro

2.2 Distribuição de Frequência


2.2.1 Dados brutos, Rol e Estatı́sticas de Ordem
Quando observa-se alguma variável de interesse, em geral anotam-se os resultados na ordem em que
aparecem. Esta lista de dados não ordenada é conhecida como lista de dados brutos. Quando ordenam-
se estes dados – em ordem crescente ou decrescente – obtém-se um rol, dando origem às estatı́sticas de
ordem. Em uma distribuição de n elementos x1 , x2 , . . ., xn observados sequencialmente, denotam-se os
dados ordenados de forma crescente por x(1) , x(2) , . . ., x(n) e, analogamente, x(n) , x(n−1) , . . ., x(1) para
a ordenação decrescente.

Exemplo 2.12. (Rol) Se ordenarmos os dados da Tabela 1.1 da página 5, obtemos o seguinte rol:

x(1) x(2) x(3) x(4) x(5) x(6)


7 20 124 186 191 402

Tabela 2.1: Rol do número de passos até a lixeira mais próxima na capital gaúcha

O menor número de passos caminhados foi sete, representado por x(1) = 7, e o maior foi quatrocentos
e dois, representado por x(6) = 402.

> (x <- c(186,402,191,20,7,124)) # Criando e apresentando o vetor original de dados brutos

[1] 186 402 191 20 7 124

> sort(x) # Apresentando o rol, ou vetor ordenado. Teste ?order

[1] 7 20 124 186 191 402

> sort(x, decreasing = T) # Ordem decrescente, onde T indica TRUE (padr~


ao: FALSE)

[1] 402 191 186 124 20 7

,
Em um primeiro momento estas definições podem parecer ultrapassadas, mas são de grande impor-
tância na construção de métodos avançados de análise de dados. Como atualmente trabalham-se com
bases de dados em formato eletrônico, em geral é fácil realizar a ordenação de grandes volumes de dados.
É importante ressaltar, porém, que em certos casos é necessário muito poder de processamento para
executar tais ordenações, podendo se tornarem impraticáveis pelo alto custo computacional.

EXERCÍCIOS

1. Considere o conjunto de dados 10, −4, 5, 7, 1, 3, 9.

a) Obtenha o rol.
b) Indique e interprete x(4) .

Page 12
DRAFT VERSION
2.2.2 Tabela de frequência univariada discreta
Listas muito longas, ainda que ordenadas, não costumam ser de fácil compreensão. Assim, a tabela de
frequência univariada discreta é uma boa maneira de consolidar os dados de uma variável que assuma
até 7 diferentes valores. Esta tabela deve apresentar pelo menos uma coluna descrevendo a variável de
interesse e uma coluna com a frequência (da classe), i.e., o número de observações contempladas em cada
categoria. Sugere-se também a apresentação de uma coluna indicando a classe, denotada por i conforme
Tabela 2.2. Como exercı́cio, faça k = 4 e fi = 13, i ∈ {1, 2, . . . , k} e reescreva a Tabela 2.2. Depois crie
uma variável interessante para atribuir a X.

i xi fi f ri Fi Fri `i `ri
1 x1 f1 f1 /n F1 = f1 F1 /n `1 = `2 + f1 = n `1 /n = 1
2 x2 f2 f2 /n F2 = F1 + f2 F2 /n `2 = `3 + f2 `2 /n
3 x3 f3 f3 /n F3 = F2 + f3 F3 /n `3 = `4 + f3 `3 /n
.. .. .. .. .. .. .. ..
. . . . . . . .
k−2 xk−2 fk−2 fk−2 /n Fk−2 = Fk−3 + fk−2 Fk−2 /n `k−2 = `k−1 + fk−2 `k−2 /n
k−1 xk−1 fk−1 fk−1 /n Fk−1 = Fk−2 + fk−1 Fk−1 /n `k−1 = `k + fk−1 `k−1 /n
k xk fk fk /n Fk = Fk−1 + fk = n Fk /n = 1 `k = fk `k /n
Total - n 1 - - - -

Tabela 2.2: Tabela de frequência genérica. Faça o exercı́cio proposto que melhora.

Para a classe genérica i são calculadas as seguintes frequências:


• fi : Frequência (simples/absoluta)
• fri : Frequência relativa
• Fi : Frequência acumulada
• Fri : Frequência acumulada relativa
• `i : Frequência acumulada inversa
• `ri : Frequência acumulada inversa relativa.
Exemplo 2.13. (Sugestão) X: Naipes de um baralho.
,
Exemplo 2.14. (Número de filhos revisitado) Do Exemplo 2.5 observou-se a variável
X: ‘número de filhos de mulheres atendidas em um hospital público de POA durante o inverno 2012’.
A Tabela 2.3 apresenta os dados na ordem em que foram observados. Este tipo de apresentação é
bastante completo, mas dificulta a extração de informações relevantes. Como exercı́cio, indique o número
máximo de filhos observados na amostra.

i xi i xi i xi i xi i xi i xi i xi i xi i xi i xi
1 2 11 3 21 2 31 1 41 1 51 2 61 3 71 1 81 0 91 1
2 0 12 2 22 3 32 1 42 1 52 4 62 0 72 3 82 1 92 3
3 1 13 3 23 1 33 1 43 4 53 1 63 2 73 1 83 2 93 3
4 2 14 2 24 2 34 1 44 1 54 3 64 0 74 3 84 2 94 4
5 4 15 1 25 2 35 0 45 1 55 1 65 2 75 3 85 2 95 5
6 2 16 4 26 1 36 2 46 3 56 2 66 2 76 4 86 2 96 1
7 1 17 2 27 4 37 3 47 1 57 0 67 2 77 2 87 2 97 0
8 4 18 0 28 0 38 3 48 1 58 2 68 1 78 1 88 4 98 0
9 2 19 1 29 1 39 1 49 4 59 3 69 2 79 2 89 0 99 3
10 3 20 4 30 6 40 2 50 2 60 3 70 3 80 3 90 2 100 2

Tabela 2.3: Dados brutos de X

A Tabela 2.4 apresenta o número de filhos ordenados, fornecendo ainda algumas frequências que
auxiliam o entendimento da distribuição. Com a apresentação no formato da Tabela 2.4, facilmente se

Page 13
DRAFT VERSION
observa um máximo de 6 filhos na amostra, ao contrário da tabela de dados brutos. Perde-se apenas a
ordem na qual os dados foram observados, o que em geral não é do interesse do pesquisador.

i xi fi fri Fi Fr i `i `ri
1 0 11 11/100 = 0.11 11 11/100 = 0.11 89 + 11 = 100 100/100 = 1
2 1 27 27/100 = 0.27 11 + 27 = 38 38/100 = 0.38 62 + 27 = 89 89/100 = 0.89
3 2 30 30/100 = 0.30 38 + 30 = 68 68/100 = 0.68 32 + 30 = 62 62/100 = 0.62
4 3 19 19/100 = 0.19 68 + 19 = 87 87/100 = 0.87 13 + 19 = 32 32/100 = 0.32
5 4 11 11/100 = 0.11 87 + 11 = 98 98/100 = 0.98 2 + 11 = 13 13/100 = 0.13
6 5 1 1/100 = 0.01 98 + 1 = 99 99/100 = 0.99 1+1=2 2/100 = 0.02
7 6 1 1/100 = 0.01 99 + 1 = 100 100/100 = 1 1 1/100 = 0.01
Total - 100 1 - - - -

Tabela 2.4: Tabela de frequência de X

Note que a coluna i da Tabela 2.3 indica a ordem da mulher entrevistada, enquanto na Tabela 2.4 i
indica a classe. Por exemplo, i = 4 indica a quarta mulher entrevistada, que no caso informou ter x4 = 2
filhos. Na Tabela 2.4, i = 4 indica a quarta classe onde x4 = 3, i.e., a classe das mulheres que possuem
3 filhos.

As únicas colunas que exigem a leitura dos dados brutos são a da variável xi e a da frequência fi ;
as demais são calculadas a partir de fi . A seguir estão alguns exemplos de interpretação das frequências
apresentadas na Tabela 2.4.
• f5 = 11, i.e., 11 mulheres possuem 4 filhos;
• fr5 = 0.11 = 11%, i.e., 11% das mulheres possuem 4 filhos;
• F4 = 87, i.e., 87 mulheres possuem até 3 filhos (ou ‘de zero a 3 filhos’, mas esta alternativa é
menos elegante);
• Fr3 = 0.68 = 68%, i.e., 68% das mulheres possuem até 2 filhos;
• `3 = 62, i.e., 62 mulheres têm pelo menos 2 filhos;
• `r2 = 0.89 = 89%, i.e., 89% das mulheres têm pelo menos 1 filho.
,
Exemplo 2.15. (Número de filhos R-visitado) Exemplo 2.14 utilizando R/RStudio.

> # Lendo o arquivo '[Link]' direto do link


> hosp <- [Link]('[Link] head = T)
> dim(hosp) # Dimens~
ao: 100 linhas por 2 colunas

[1] 100 2

> head(hosp) # Apresenta as 6 primeiras linhas do objeto 'hosp'; teste tail(hosp, 10)

filhos altura
1 2 1.59
2 0 1.58
3 1 1.70
4 2 1.62
5 4 1.67
6 2 1.62

> attach(hosp) # Para deixar as colunas de 'hosp' disponı́veis


> (tab <- table(filhos)) # Frequ^
encia (simples/absoluta)

filhos
0 1 2 3 4 5 6
11 27 30 19 11 1 1

Page 14
DRAFT VERSION
> [Link](tab) # Frequ^
encia relativa

filhos
0 1 2 3 4 5 6
0.11 0.27 0.30 0.19 0.11 0.01 0.01

> cumsum(tab) # Frequ^


encia acumulada

0 1 2 3 4 5 6
11 38 68 87 98 99 100

> round(cumsum(tab)/length(filhos),2) # Frequ^


encia acumulada relativa

0 1 2 3 4 5 6
0.11 0.38 0.68 0.87 0.98 0.99 1.00

> cumsum(rev(tab)) # Frequ^


encia acumulada inversa

6 5 4 3 2 1 0
1 2 13 32 62 89 100

> round(cumsum(rev(tab))/length(filhos),2) # Frequ^


encia acumulada relativa inversa

6 5 4 3 2 1 0
0.01 0.02 0.13 0.32 0.62 0.89 1.00

EXERCÍCIOS
2. Em uma fábrica retirou-se uma amostra de 50 peças de um lote de certo material e contou-se o número de defeitos
em cada peça, apresentados na tabela a seguir.

i # defeitos fi f ri Fi F ri
1 0 17
2 1 10
3 2
4 3 8
5 4 5
6 5 1
Total - 50

a) Classifique a variável ‘número de defeitos’.


b) Qual a frequência absoluta da classe 3? Interprete.
c) Qual a frequência relativa da classe 3? Interprete.
d) Qual a frequência acumulada da classe 4? Interprete.
e) Qual a frequência acumulada relativa da classe 5? Interprete.
f) Represente os dados utilizando o gráfico que você considerar mais adequado.

3. Em 13 de março de 1883, estavam Émile Durkheim e Max Weber no leito de morte de Karl Marx discutindo a
respeito de propriedade intelectual. Weber, o mais jovem e disposto da turma, com apenas 19 anos, coletou algumas
informações a respeito da Convenção de Paris de 1883, que aconteceria em uma semana. Em suas anotações, estava
o número de unidades monetárias que deveria ser paga anualmente por cada paı́s membro do tratado, dependendo
da classe à qual o paı́s pertencesse18 . O valor da unidade iria variar de acordo com a inflação e outros fatores
econômicos da época corrente. A tabela abaixo apresenta o resultado dos estudos de Weber.
a) Qual a frequência simples da classe VI? Interprete.
b) Qual a frequência relativa da classe I? Interprete.
c) Qual a frequência acumulada da classe II? Interprete.
d) Qual a frequência acumulada relativa da classe III? Interprete.

18 Paris Convention for the Protection of Industrial Property (1883), WIPO Database of Intellectual Property. [Link].

int/treaties/en/[Link]?file_id=288514

Page 15
DRAFT VERSION
Classe Unidades fi fR i Fi FRi
I 25 21
II 20 26
III 15 10
IV 10 9
V 5 32
VI 3 38
VII 1 37
Total - 173

2.2.3 Tabela de frequência univariada contı́nua


Quando uma variável assume mais de 10 diferentes valores, recomenda-se utilizar a tabela de frequência
univariada contı́nua. A diferença para a tabela discreta da Seção 2.2.2 é que na contı́nua distribuem-se
os valores em intervalos de classe, i.e., faixas de valores com certa amplitude. A principal vantagem
desta abordagem é a capacidade de apresentar os dados de maneira enxuta. O contraponto, como em
qualquer resumo de dados, é a perda da informação original.

Amplitude (h) e quantidade (k) de classes

Quando deseja-se apresentar a variável em intervalos de classe, é necessário determinar a amplitude


do intervalo de classe (h) e a quantidade de classes (k) em que serão dispostos os dados. Apresentam-se
a seguir três das principais regras para determinar h e k.

• Sturges (1926) sugere que a amplitude do intervalo de classe seja calculada por

A max X − min X
hSt = = , (4)
kSt 1 + 3.322 log10 n

onde A é a amplitude (dos dados) descrita na Seção 2.4.1, não devendo ser confundida com h. O
denominador é obtido a partir da expansão binomial, na forma
k−1
X 
k−1
n = = 2k−1 (5)
i=0
i
∴ kSt = d1 + log2 ne ≈ d1 + 3.322 log10 ne , (6)

onde d e indica a função teto, o menor inteiro consecutivo denotado por dxe = min{n ∈ N|n ≥ x}.
Alguns pacotes computacionais atribuem o número de classes aplicando regras que encontrem um valor
‘bonito’ para a divisão. Tais valores são obtidos computando números que sejam 0, 1, 2 ou 5 vezes uma
potência de 10, i.e., a × 10b , a ∈ {0, 1, 2, 5} e b ∈ N ∪ {−1}.
Exemplo 2.16. (Sturges) Se forem observados n = 100 valores com amplitude (dos dados) A = 0.23, a
amplitude da classe sugerida por Sturges é
0.23
hSt = = 0.02875,
1 + log2 100

e a quantidade de classes
kSt = d1 + log2 100e = d7.644e = 8.

Page 16
DRAFT VERSION
> n <- length(altura) # n=100, número de dados a serem tabulados
> A <- diff(range(altura)) # Amplitude (dos dados, n~ao da classe!)
> ceiling(1 + log2(n)) # Pela Equaç~
ao (6), usando log2

[1] 8

> ceiling(1 + 3.322*log10(n)) # Pela Equaç~


ao (6), usando log10

[1] 8

> (kSt <- [Link](altura)) ao '[Link]'


# Pela funç~

[1] 8

> (hSt <- A/kSt) # Pela Equaç~


ao (4)

[1] 0.02875

> pretty(kSt) # Valores 'bonitos', (a=5, b=0) e (a=1, b=1)

[1] 5 10

,
• Scott (1979) incorpora s, o desvio padrão amostral19 ao cálculo da amplitude do intervalo, na forma
3.5s
hSc = . (7)
n1/3
O número de classes de Scott pode ser obtido por
   
A maxX − minX
kSc = = . (8)
hSc 3.5s/n1/3
Exemplo 2.17. (Scott) Se forem observados n = 100 valores com desvio padrão amostral s = 0.045268559,
a amplitude da classe sugerida por Scott é
3.5 × 0.045268559
hSc = = 0.034134854.
1001/3
Se A = 0.23, a quantidade de classes é
 
0.23
kSc = = d6.7379811e = 7.
0.034134854

> n <- length(altura) # n=100, número de observaç~


oes a serem tabuladas
> s <- sd(altura) # s=0.045268559, desvio padr~ ao amostral
> A <- diff(range(altura)) # Amplitude (dos dados, n~ao da classe!)
> (hSc <- 3.5*s/n^(1/3)) # Pela Equaç~
ao (7)

[1] 0.03413485378

> ceiling(A/hSc) # k sugerido por Scott, Equaç~


ao (8)

[1] 7

> (kSc <- [Link](altura)) ao '[Link]'


# k obtido pela funç~

[1] 7

> pretty(kSc) # Valores 'bonitos', (a=5, b=0) e (a=1, b=1)

[1] 5 10

19 Seção 2.4.3.

Page 17
DRAFT VERSION
,

• Freedman-Diaconis (1981) inserem a amplitude interquartı́lica no cálculo da amplitude do intervalo,


na forma
AI
hF D = 2 , (9)
n1/3
onde AI = Q3 − Q1 é a amplitude interquartı́lica, apresentada na Seção 2.6.4. O número de classes
obtido como consequência da aplicação da relação de Freedman-Diaconis é
   
A maxX − minX
kF D = = . (10)
hF D 2 AI n1/3

Exemplo 2.18. (Freedman-Diaconis) Se forem observados n = 100 valores com amplitude interquartı́lica
de AI = 0.0525, a amplitude da classe sugerida por Freedman-Diaconis é
2 × 0.0525
hF D = = 0.022621564.
1001/3
Se A = 0.23, e a quantidade de classes
 
0.23
kF D = = d10.16729e = 11.
0.022621564

> n <- length(altura) # n=100, número de observaç~


oes a serem tabuladas
> (Q <- quantile(altura, c(1/4,3/4))) # Primeiro e terceiro quartis

25% 75%
1.5975 1.6500

> (AI <- diff([Link](Q))) # Amplitude Interquatı́lica

[1] 0.0525

> (hFD <- 2*AI/n^(1/3)) # Pela Equaç~


ao (9)

[1] 0.02262156425

> A <- diff(range(altura)) # Amplitude (dos dados, n~


ao da classe ou interquartı́lica!)
> ceiling(A/hFD) # k sugerido por Freedman-Diaconis, Equaç~
ao (10)

[1] 11

> (kFD <- [Link](altura)) ao '[Link]'


# Pela funç~

[1] 11

> pretty(kFD) # Valores 'bonitos', (a=1, b=1) e (a=2, b=1)

[1] 10 20

,
Hyndman (1995)20 argumenta que as regras de Scott e Freedman-Diaconis são tão simples quanto
a regra de Sturges, mas melhor fundamentadas na teoria estatı́stica. Além disso, a regra de Sturges
funciona bem para tamanhos de amostra moderados (n < 200), mas não para valores grandes de n.
20 [Link]

Page 18
DRAFT VERSION
Exemplo 2.19. (Comparando os três métodos) Foi realizada uma simulação com tamanhos de amostra
n = 10i , i ∈ {1, 2, . . . , 6}, indicando o número de classes sugerido por cada método.

> NC <- function(x) c(i = i, n = 10^i, # Quantidades simuladas


Sturges = [Link](x), # Sturges (1926)
Scott = [Link](x), # Scott (1979)
FD = [Link](x)) # Freedman-Diaconis (1981)
> for(i in 1:6){[Link](i); print(NC(rnorm(10^i)))} # Pode ser demorado para i>6

i n Sturges Scott FD
1 10 5 2 3
2 100 8 6 7
3 1000 11 19 25
4 10000 15 44 56
5 100000 18 112 145
6 1000000 21 278 360

,
Exemplo 2.20. (Alturas de mulheres) Seja a variável

Y : ‘altura de mulheres atendidas em um hospital público de Porto Alegre durante o inverno 2012’.

A Tabela 2.5 apresenta os dados brutos. Este tipo de apresentação é bastante completo, mas dificulta
a extração de informações relevantes. Como exercı́cio, indique quantas mulheres têm altura entre 1.70m
e 1.75m a partir desta tabela.

i yi i yi i yi i yi i yi
1 1.59 21 1.63 41 1.58 61 1.70 81 1.64
2 1.58 22 1.64 42 1.66 62 1.65 82 1.60
3 1.70 23 1.64 43 1.59 63 1.51 83 1.68
4 1.62 24 1.62 44 1.67 64 1.66 84 1.65
5 1.67 25 1.66 45 1.62 65 1.52 85 1.65
6 1.62 26 1.61 46 1.55 66 1.60 86 1.64
7 1.69 27 1.61 47 1.64 67 1.62 87 1.55
8 1.60 28 1.60 48 1.62 68 1.68 88 1.66
9 1.61 29 1.61 49 1.65 69 1.65 89 1.59
10 1.58 30 1.64 50 1.66 70 1.61 90 1.66
11 1.64 31 1.59 51 1.64 71 1.56 91 1.69
12 1.72 32 1.60 52 1.57 72 1.65 92 1.61
13 1.74 33 1.62 53 1.65 73 1.62 93 1.58
14 1.63 34 1.53 54 1.69 74 1.63 94 1.73
15 1.64 35 1.58 55 1.65 75 1.57 95 1.56
16 1.63 36 1.60 56 1.62 76 1.62 96 1.59
17 1.59 37 1.61 57 1.68 77 1.54 97 1.65
18 1.64 38 1.67 58 1.60 78 1.64 98 1.63
19 1.59 39 1.68 59 1.68 79 1.66 99 1.70
20 1.65 40 1.56 60 1.59 80 1.56 100 1.60

Tabela 2.5: Dados brutos de Y

Para colocar estes valores em uma tabela de frequência, obteve-se kSt = 8 pela regra de Sturges21 , e
pelo resultado de pretty(8) decidiu-se por 5 classes22 . Como exercı́cio, obtenha kSc e kF D .
A Tabela 2.6 apresenta as alturas agrupadas em cinco classes de amplitude 5cm, fornecendo ainda
algumas frequências que auxiliam o entendimento da distribuição. Facilmente observam-se 6 mulheres
21 Exemplo 2.16.
22 A função pretty escolhe valores que sejam 1, 2 ou 5 vezes uma potência de 10.

Page 19
DRAFT VERSION
com altura entre 1.70m e 1.75m,23 ao contrário da tabela de dados brutos. Note, porém, que não é
possı́vel saber exatamente a altura de cada uma destas 6 mulheres. Isso acontece pois resumo implica em
perda de informação, cabendo ao pesquisador decidir quando e como resumir os dados.

i yi fi fri Fi Fr i `i `ri
1 1.50 ` 1.55 4 0.04 4 0.04 96 + 4 = 100 100/100 = 1
2 1.55 ` 1.60 21 0.21 4 + 21 = 25 0.25 75 + 21 = 96 96/100 = 0.96
3 1.60 ` 1.65 41 0.41 25 + 41 = 66 0.66 34 + 41 = 75 75/100 = 0.75
4 1.65 ` 1.70 28 0.28 66 + 28 = 94 0.94 6 + 28 = 34 34/100 = 0.34
5 1.70 ` 1.75 6 0.06 94 + 6 = 100 1 6 6/100 = 0.06
Total - 100 1 - - - -

Tabela 2.6: Tabela de frequência de Y

A seguir estão alguns exemplos de interpretação das frequências apresentadas na Tabela 2.6.

• f5 = 6, i.e., 6 mulheres têm entre 1.70m e 1.75m de altura;


• fr5 = 0.06 = 6%, i.e., 6% das mulheres tem entre 1.70m e 1.75m de altura;
• F4 = 94, i.e., 94 mulheres têm até 1.70m de altura, ou de 1.50m a 1.70m;
• Fr2 = 0.25 = 25%, i.e., 25% das mulheres tem até 1.60m de altura, ou de 1.50m a 1.60m;
• `3 = 75, i.e., 75 mulheres têm pelo menos 1.60m de altura;
• `r4 = 0.34 = 34%, i.e., 34% das mulheres tem pelo menos 1.65m de altura.

,
Exemplo 2.21. (Alturas de mulheres R-visitado) Exemplo 2.20 utilizando R/RStudio.

> # Lendo o arquivo '[Link]' direto do link


> hosp <- [Link]('[Link] head = T)
> dim(hosp) # Dimens~
ao: 100 linhas por 2 colunas

[1] 100 2

> head(hosp) # Apresenta as 6 primeiras linhas do objeto 'hosp'; teste tail(hosp, 10)

filhos altura
1 2 1.59
2 0 1.58
3 1 1.70
4 2 1.62
5 4 1.67
6 2 1.62

> attach(hosp) # Para deixar as colunas de 'hosp' disponı́veis


> pretty([Link](altura)) # Valores 'bonitos' para o número de classes

[1] 5 10

> hist(altura)$breaks ao 'hist'


# Quebras de valores gerados com a funç~

[1] 1.50 1.55 1.60 1.65 1.70 1.75

23 Noteque a simbologia 1.70 ` 1.75 indica a inclusão de 1.70 e a exclusão de 1.75, i.e., este é um intervalo fechado à
esquerda e aberto à direita. Equivale às notações [1.70, 1.75[ (mais moderna) ou [1.70, 1.75) (mais antiga).

Page 20
DRAFT VERSION
> (f <- hist(altura)$counts) # Frequ^
encias das classes

[1] 6 27 43 21 3

> cumsum(f) # Frequ^


encia acumulada

[1] 6 33 76 97 100

> round(cumsum(f)/length(altura),2) # Frequ^


encia acumulada relativa

[1] 0.06 0.33 0.76 0.97 1.00

> cumsum(rev(f)) # Frequ^


encia acumulada inversa

[1] 3 24 67 94 100

> round(cumsum(rev(f))/length(altura),2) # Frequ^


encia acumulada relativa inversa

[1] 0.03 0.24 0.67 0.94 1.00

EXERCÍCIOS
4. Foram medidas as alturas de 100 alunos de certa disciplina, apresentadas na tabela a seguir.

i Altura (cm) fi fRi Fi FRi


1 140 ` 150 2
2 150 ` 160 13
3 160 ` 170
4 170 ` 180 47
5 180 à 190 8
Total - 100

a) Classifique a variável ‘altura’.


b) Qual a frequência relativa da classe 3? Interprete.
c) Qual a frequência acumulada da classe 4? Interprete.
d) Qual a frequência acumulada relativa da classe 2? Interprete.
e) Quantos alunos têm pelo menos 1.60m?
f) Represente os dados utilizando o gráfico que você considerar mais adequado.

5. Obtenha os intervalos de classes dos dados da Tabela 2.5:


a) Pela regra de Scott.
b) Pela regra de Freedman-Diaconis.

6. Demonstre a Equação (5).

2.2.4 Tabela (de frequência) bivariada


Em muitas situações práticas há interesse em avaliar a associação de atributos. A tabela (de frequência)
bivariada, tabela de dupla entrada ou tabela de contingência 2 × 2 tem essa finalidade. Genericamente
utilizam-se as letras X e Y para se referir às variáveis. As simbologias 1 e 0 indicam respectivamente a
presença e ausência das caracterı́sticas X e Y .

Razão de Chances (Odds Ratio - OR)

A razão de chances ou razão de possibilidades é uma medida utilizada para avaliar o quanto um
atributo pode influenciar em outro. Pode ser escrita em função de nij conforme Equação (11) ou π̂ij
como indicado na Equação (12).

Page 21
DRAFT VERSION
Y
X
1 0 Total
1 n11 n12 n1·
0 n21 n22 n2·
Total n·1 n·2 n

Tabela 2.7: Tabela bivariada genérica

n11 /n12 n11 n22


OR = = (11)
n21 /n22 n12 n21

π̂11 /π̂12 π̂11 π̂22


OR = = , (12)
π̂21 /π̂22 π̂12 π̂21
nij
onde π̂ij = .
n
Exemplo 2.22. (Odds Ratio) Suponha um estudo da relação entre os atributos X: ‘aluno não usa
celular em sala de aula’ e Y : ‘aluno é aprovado na disciplina’, conforme Tabela 4.4.

Y
X
1 0 Total
1 90 10 100
0 70 30 100
Total 160 40 200

Tabela 2.8: X = 1: aluno não usa celular em aula. Y = 1: aluno é aprovado na disciplina.

Pela Equação (11),

90/10 90 × 30
OR = = ≈ 3.86.
70/30 10 × 70

Com este valor estima-se que alunos que não usam celular em sala de aula possuem 3.86 vezes a
chance (ou 3.86 − 1 = 2.86 vezes mais chance) de serem aprovados na disciplina em relação aos alunos
que utilizam o aparelho durante as aulas. Refaça o exemplo invertendo os rótulos 0 e 1.

> [Link] <- matrix(c(90,10,70,30), nrow=2, byrow=T) # Tabela 2.8


> (OR <- ([Link][1,1]/[Link][1,2])/([Link][2,1]/[Link][2,2]) ) # Equaç~
ao (11)

[1] 3.857142857

Risco Relativo (Relative Risk - RR)

Risco Relativo é uma medida baseada em taxas de incidência entre os grupos exposto (X = 1) e não
exposto (X = 0) ao fator de risco em estudo. É obtido pelo quociente entre as estimativas da taxa de
incidência do grupo exposto (γ̂1 ) e da taxa de incidência do grupo não exposto (γ̂0 ) conforme Equação
(13).

γ̂1 n11 /n1·


RR = = (13)
γ̂0 n21 /n2·

Page 22
DRAFT VERSION
Exemplo 2.23. (Risco Relativo) Suponha novamente os dados do Exemplo 2.22. O risco relativo pode
ser calculado pela Equação (13):

90/100
RR = ≈ 1.29
70/100

Com este valor estima-se que o grupo que não usa celular é aprovado em 29% mais casos em compa-
ração ao grupo do Whats e Face.

> [Link] <- matrix(c(90,10,70,30), nrow=2, byrow=T) # Tabela 2.8


> (RR <- ([Link][1,1]/sum([Link][1,]))/([Link][2,1]/sum([Link][2,])) ) # Equaç~
ao (13)

[1] 1.285714286

Independência

A tabela (de frequência) bivariada permite avaliar a independência entre dois atributos, indicando a
ausência de relação, simbolizada por X ⊥⊥ Y . Se não existe tal relação, é esperado encontrar a mesma
proporção de portadores da caracterı́stica X entre os portadores e não portadores de Y . Assim, se X e
Y são independentes, a proporção de sujeitos que apresentam simultaneamente as caracterı́sticas X e Y
é igual à proporção dos X multiplicada pela proporção dos Y , sob qualquer uma das formas:
 n11 n1·
 n = n



 ·1


 n11 = n·1



 n1·

n
 n1· n·1
n11 =






 n

 n11 = n1·
   n 
·1


n n n
Exemplo 2.24. (Independência 1) Se há 578 sujeitos portadores do atributo X e 216 portadores de Y
em 1156 observações, espera-se que existam
n1· n·1 578 × 216
= = 108
n 1156
sujeitos portadores de X e Y se X ⊥
⊥Y.
,
Exemplo 2.25. (Independência 2) Se existem 15% de sujeitos X e 80% de Y , espera-se que existam
 n   n   15   80 
1· ·1
= = 12%
n n 100 100

de sujeitos X e Y se X ⊥
⊥Y.
,
Exemplo 2.26. (Independência 3) Se OR = 1, então X ⊥
⊥Y.
,

Page 23
DRAFT VERSION
2.3 Medidas de Posição (ou Localização)
2.3.1 Mı́nimo e Máximo
O mı́nimo de uma distribuição é o menor valor observado desta distribuição; de forma análoga, o máximo
é o maior valor. São estatı́sticas de ordem, mais especificamente os extremos de um conjunto de dados
ordenado (rol24 ). Para uma distribuição de n elementos são denotadas por min X = x(1) e max X = x(n) .
Apesar da simplicidade destas medidas, existem considerações teóricas sofisticadas a seu respeito.
Para maiores detalhes, vide ?.
Exemplo 2.27. (Mı́nimo e máximo) Suponha novamente as n = 100 observações da variável Y: ‘altura
de mulheres atendidas em um certo hospital público de Porto Alegre durante o inverno 2012’, apresentadas
na Tabela 2.5. O mı́nimo e o máximo são denotados, respectivamente, por min Y = y(1) = 1.51 e
max Y = y(100) = 1.74.

> attach([Link]('[Link] head = T))


> min(altura) # Mı́nimo

[1] 1.51

> max(altura) # Máximo

[1] 1.74

> range(altura) ao 'range' fornece o mı́nimo e o máximo


# A funç~

[1] 1.51 1.74

,
Exemplo 2.28. (Velocidade máxima) Segundo o Código de Trânsito Brasileiro25 , a placa da Figura 2.2
indica que a velocidade máxima da via é de 40 km/h. Isto significa que os condutores não devem ultra-
passar 40 quilômetros horários. Apesar da obviedade, boa parte dos motoristas a lêem como ‘velocidade
mı́nima’.
/

Figura 2.2: Placa de velocidade máxima, usualmente lida como ‘mı́nima’.

2.3.2 Média (Aritmética Simples)


A média (aritmética simples) ou valor esperado é uma das medidas mais importantes da Estatı́stica
devido às suas propriedades e relativa facilidade de cálculo. A média da variável X é simbolizada
24 Seção 2.2.1.
25 Lei 9.503, de 23 de setembro 1997.

Page 24
DRAFT VERSION
genericamente por µ26 quando refere-se à média universal, e por x̄n quando refere-se à média amostral.
Pode-se utilizar a notação x̄n para indicar o tamanho da amostra. Suas expressões no universo a na
amostra são dadas respectivamente pelas equações (14) e (15).
PN
i=1 xi
µ= (14)
N

Pn
i=1 xi
x̄n = (15)
n
Por distribuir a soma dos valores da distribuição pelo número de observações, a média é uma medida
que indica centro de massa, conforme Figura 2.3.

Figura 2.3: Média aritmética simples como centro de massa

Exemplo 2.29. (Média aritmética simples) Suponha novamente os dados do Exemplo 1.1 da página 5.
O número médio de passos até a lixeira mais próxima foi de
P6
xi 186 + 402 + 191 + 20 + 7 + 124 930
E(X) = x̄6 = i=1 = = = 155.
6 6 6

> x <- c(186,402,191,20,7,124) # Vetor de dados brutos


> mean(x) # Aplica as Equaç~
oes (14) e (15). Veja ?mean

[1] 155

Linearidade da média aritmética

A propriedade de linearidade da média aritmética permite calcular médias após algumas transforma-
ções nos dados. Pode ser escrita como

E(aX + bY + c) = aE(X) + bE(Y ) + c (16)

Exemplo 2.30. (Linearidade da média aritmética) Suponha uma variável X com média E(X) = 155.
Se todos os valores da distribuição forem multiplicados por 3 e subtraı́dos por 1, a nova média será

E(3X − 1) = 3E(X) − 1 = 3 × 155 − 1 = 464.

> x <- c(186,402,191,20,7,124) # Vetor de dados brutos


> 3*mean(x)-1 # Aplicando a propriedade (16)

[1] 464

Como exercı́cio, realize o procedimento proposto para os dados do Exemplo 2.29 e verifique o resultado.

,
26 Também pode ser representada por µX ou E(X).

Page 25
DRAFT VERSION
2.3.3 Total
Total é a soma de todos os valores de uma variável. Suas expressões são dadas pelas equações (17) e
(18).

N
X
τ= xi (17)
i=1

n
NX
τ̂ = xi = N x̄n , (18)
n i=1

onde x̄n é a média amostral, apresentada na Equação (15).


Exemplo 2.31. (Total) Suponha novamente os dados do Exemplo 2.29. Se alguém precisar de uma
lixeira 20 vezes na capital gaúcha, estima-se que o número total de passos a serem caminhados é de
20
τ̂ = × 930 = 20 × 155 = 3100.
6

> N <- 20 # Tamanho do universo


> x <- c(186,402,191,20,7,124) # Vetor de dados brutos
> N*mean(x) # Equaç~
ao (18)

[1] 3100

2.3.4 Média (Aritmética) Ponderada


A média (aritmética) ponderada é uma média na qual se atribui peso pi para o i-ésimo valor da distribui-
ção. Não será feita distinção entre as médias ponderada universal e amostral, anotando-se genericamente
Pn
pi xi
W = Pi=1 n . (19)
i=1 pi

Exemplo 2.32. (Água do chimarrão) Média ponderada é como colocar água quente e fria para regular
a temperatura do mate. Suponha 1 litro de água em uma garrafa térmica, onde coloque-se 850mL (85%)
de água a 96 ◦ C e 150 mL (15%) de água a 30 ◦ C. Desconsiderando variações externas, essa mistura
deve ficar em
850mL × 96 ◦ C + 150mL × 30 ◦ C
W = = 0.85 × 96 ◦ C + 0.15 × 30 ◦ C = 81.6 ◦ C + 4.5 ◦ C = 86.1 ◦ C.
850mL + 150mL

> [Link](c(96,30), c(850,150)) # Facilita uma barbaridade

[1] 86.1

,
Exemplo 2.33. (Cálculo do G1) Suponha que o senhor Z, professor de certa instituição de ensino
superior, avalie os alunos no Grau 1 atribuindo peso 8 para a média das três provas – P1 , P2 e P3 –,
peso 2 para a média dos dois trabalhos de maior nota – denotados por T(3) e T(2) – e peso zero para o
trabalho de menor nota, denotado por T(1) . Assim, o cálculo do Grau 127 é dado por
 
T +T
8 × P1 +P32 +P3 + 2 × (3) 2 (2) + 0 × T(1)
    
P1 + P2 + P3 T(3) + T(2)
G1 = = 0.8 + 0.2 . (20)
8+2+0 3 2
27 Lembre-se que o sistema da PUCRS trunca os valores. Vide Seção 1.5.

Page 26
DRAFT VERSION
Se as notas de Joãozinho foram P1 = 6, P2 = 5, P3 = 10, T(3) = 8, T(2) = 7 e T(1) = 5,
   
6 + 5 + 10 8+7
G1 = 0.8 + 0.2 = 7.1.
3 2

> [Link](c(mean(c(6,5,10)),mean(c(7,8))), c(0.8,0.2)) # Simule com as suas notas

[1] 7.1

> g1 <- function(p1,p2,p3, t1,t2,t3){ # Funç~


oes podem ser personalizadas
mp <- mean(c(p1,p2,p3)) # Média das 3 provas
mt <- (sum(t1,t2,t3) - min(t1,t2,t3))/2 # Média dos 2 trabalhos de maior nota
return(trunc(0.8*mp + 0.2*mt, prec = 1)) # Aplicando a ponderaç~
ao e truncando
}
> g1(6,5,10, 5,7,8) ao 'g1'
# Aplicando a funç~

[1] 7.1

2.3.5 Média Geométrica


A média geométrica é utilizada para calcular médias de ı́ndices, bem como em casos em que as medidas
possuam magnitudes numéricas distintas. É definida por
p
G = n Πni=1 xi . (21)
Exemplo 2.34. (Média geométrica) Sejam os ı́ndices LP P
2004,2008 = 139.58% e P2004,2008 = 97.22%. Sua
média geométrica é dada por √
G = 1.3958 × 0.9722 ≈ 116.49%.
Este valor é conhecido como Índice de Preço de Fisher28 .

> sqrt(1.3958*.9722) # 'sqrt': square root

[1] 1.164902039

2.3.6 Média Harmônica

A média harmônica é utilizada para calcular médias de taxas. É definida por


n n
H= 1 1 1 =
Pn 1 . (22)
x1 + x2 + · · · + xn i=1 xi

Exemplo 2.35. (Média harmônica) Suponha que um veı́culo viajou uma certa distância a 60 km/h e a
mesma distância novamente a 90 km/h. Sua velocidade média pode ser calculada pela média harmônica
2
H= 1 1 = 72km/h,
60 + 90

i.e., se o veı́culo percorresse toda a distância a 72 km/h, faria o trajeto no mesmo tempo.

> 2/((1/60)+(1/90)) # Pela Equaç~


ao (22)

[1] 72

> 1/mean(1/c(60,90)) # Alternativa

[1] 72

28 Seção 6.3.3.

Page 27
DRAFT VERSION
,

2.3.7 Média Quadrática

A média quadrática é a média dos valores ao quadrado, utilizada no cálculo das variâncias29 . É expressa
por
Pn
x2
Q2 = i=1 i . (23)
n
Exemplo 2.36. (Média quadrática) A média quadrática dos valores 186, 402, 191, 20, 7 e 124 é
P6
2 i=1 x2i 1862 + 4022 + 1912 + 202 + 72 + 1242 248506
Q = = = = 41417.6̄.
6 6 6

> x <- c(186,402,191,20,7,124) # Vetor de dados brutos


> mean(x^2) # Compare com mean(x)^2

[1] 41417.66667

,
p
O valor quadrático médio é a raiz quadrada da média quadrática, denotado por Q = Q2 .

2.3.8 Moda
A(s) moda(s) é (são) o(s) valor(es) mais frequente(s) de uma distribuição. Quando existe apenas uma
moda, a distribuição é conhecida como unimodal. Se existirem duas modas, a distribuição é bimodal.
Três modas configuram uma distribuição trimodal, e quatro ou mais modas indicam uma distribuição
multimodal. Distribuições com frequências equivalentes para todos os valores são ditas amodais. Quando
os dados estão agrupados deve-se indicar a classe modal, i.e., a classe de maior frequência. O esforço
computacional para calcular a moda é realizar uma contagem.
Exemplo 2.37. (Unimodal) A moda do conjunto de dados 4, 7, 1, 3, 3, 9 é M o = 3, pois ele apresenta
frequência 2 enquanto os demais valores têm frequência 1. Esta é uma distribuição unimodal.
,
Exemplo 2.38. (Bimodal) As modas do conjunto de dados 4, 7, 1, 3, 3, 9, 7 são M o0 = 3 e M o00 = 7,
pois ambos têm frequência 2 enquanto os demais valores têm frequência 1. A ordem de apresentação é
indiferente. Esta é uma distribuição bimodal.
,
Exemplo 2.39. (Amodal) O conjunto de dados 4, 7, 1, 3, 9 é dito amodal pois todos os valores têm
frequência 1.
,
Exemplo 2.40. (Moda para dados agrupados) Na Tabela 2.6 da página 20 observa-se que f3 = 41 é a
maior frequência. A classe modal é portanto a terceira, compreendida entre os valores 1.60 e 1.65.
,

2.3.9 Separatrizes (ou Quantis)


Separatrizes ou quantis 30 são medidas que dividem um conjunto de dados ordenados em k partes iguais.
O método básico consiste em obter um rol dos dados e encontrar (ainda que de forma aproximada) os
valores que repartem a distribuição de acordo com o k desejado. O esforço computacional para calcular
quaisquer separatrizes é, portanto, o de realizar a ordenação dos dados.

Mediana (k = 2)
29 Seção 2.4.2.
30 Pronuncia-se “quantı́s”.

Page 28
DRAFT VERSION
A mediana é a medida que divide metade dos dados ordenados (rol) à sua esquerda e a outra metade
à sua direita, i.e., é a medida central em termos de ordenação.
Exemplo 2.41. (Mediana para n ı́mpar) Seja o conjunto de dados 10, -4, 5, 7, 1, 3, 9, formado por
n = 7 valores. Quando ordenado obtemos o rol -4, 1, 3, 5, 7, 9, 10. Considerando k = 2, obtém-se a
separatriz 5, pois ela divide o conjunto em duas partes de mesmo tamanho (três valores abaixo de 5 e
três valores acima). Por dividir o conjunto ao meio, esta separatriz ganha o nome de mediana.

> x <- c(10, -4, 5, 7, 1, 3, 9)


> sort(x)

[1] -4 1 3 5 7 9 10

> median(x)

[1] 5

,
Quando o número de observações é par, basta tomar a média dos dois valores centrais do rol.

Exemplo 2.42. (Mediana para n par) Seja o conjunto de dados 10, -4, 5, 7, 1, 3, formado por n = 6
valores. Quando ordenado obtemos o rol -4, 1, 3, 5, 7, 10. Considerando novamente k = 2, obtém-se a
separatriz 3+52 = 4, pois ela divide o conjunto em duas partes de mesmo tamanho (três valores abaixo de
4 e três valores acima).

> x <- c(10, -4, 5, 7, 1, 3)


> sort(x)

[1] -4 1 3 5 7 10

> median(x)

[1] 4

Mediana para dados agrupados

Quando os dados estão agrupados pode-se encontrar a classe mediana utilizando a frequência acu-
mulada ou a frequência acumulada relativa.
Exemplo 2.43. (Mediana para dados agrupados) A classe mediana pode ser obtida a partir da Tabela
2.6 (página 20) de duas formas.
• A posição da mediana é 100+1
2 = 50.5. Observando a coluna Fi é possı́vel verificar que a informação
de posição 50.5 está na classe 3, que contempla da 26ª à 66ª observação. Logo, a classe mediana
é a terceira, e a mediana está no intervalo 1.60 ` 1.65.
• Observando a coluna F ri percebe-se que o valor central 0.50 = 50% está contemplado na classe 3.
Logo, a classe mediana é a terceira, e a mediana está no intervalo 1.60 ` 1.65.

,
Pode-se dividir um conjunto de dados com qualquer valor k desejado. Os mais usuais estão apresen-
tados na Tabela 2.9.
Existem diversos métodos para obtenção das separatrizes, visto que conjuntos de dados são discretos.
A função quantile apresenta nove métodos para obtenção de separatrizes, portanto recomenda-se a
leitura da documentação para maiores detalhes.

Page 29
DRAFT VERSION
k Nome Simbologia
2 Mediana Md
3 Tercil T1 , T2
4 Quartil Q1 , Q2 , Q3
10 Decil D1 , D2 , ..., D9
100 Percentil P1 , P2 , ..., P99

Tabela 2.9: Principais separatrizes

Exemplo 2.44. (Separatrizes) Suponha novamente as alturas da Tabela 2.5 da página 19. Pela função
quantile podemos facilmente obter os quantis desejados, bastando ajustar o parâmetro k desejado.

> attach([Link]('[Link] head = T))


> options(digits = 3) # Para melhorar a apresentaç~
ao
> quantile(altura, probs = seq(0, 1, 1/2)) # Mediana

0% 50% 100%
1.51 1.62 1.74

> quantile(altura, probs = seq(0, 1, 1/3)) # Tercis

0% 33.3% 66.7% 100%


1.51 1.61 1.65 1.74

> quantile(altura, probs = seq(0, 1, 1/4)) # Quartis

0% 25% 50% 75% 100%


1.51 1.60 1.62 1.65 1.74

> quantile(altura, probs = seq(0, 1, 1/10)) # Decis

0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100%
1.51 1.57 1.59 1.60 1.62 1.62 1.64 1.65 1.66 1.68 1.74

Como exercı́cio, reproduza o exemplo acima com outros valores de k. Note que a função sempre
retorna as separatrizes expressas em percentis, bem como P0 equivale ao mı́nimo e P100 ao máximo.
,

EXERCÍCIOS
1. Considere as separatrizes apresentadas na Tabela 2.9.

a) Verifique que as separatrizes mediana (Md), segundo quartil (Q2 ) são equivalentes.
b) Existem outras medidas equivalentes às do item (a)? Justifique.
c) Considere algum k diferente dos apresentados e atribua um nome e uma simbologia.
d) Se existem k ‘fatias’, quantas são as separatrizes?

Page 30
DRAFT VERSION
2.4 Medidas de Dispersão (ou Variabilidade)
2.4.1 Amplitude
A amplitude é a medida de dispersão mais simples de ser calculada, e fornece uma informação rápida
sobre a variabilidade do conjunto de dados. É calculada pela expressão

A = max X − min X. (24)

Exemplo 2.45. (Amplitude com valores positivos) A amplitude do conjunto de dados 186, 402, 191, 20,
7 e 124 é A = 402 − 7 = 395.

> A <- range(c(186,402,191,20,7,124)) ao 'range' retorna o mı́nimo e o máximo


# A funç~
> diff(A) ao 'diff' calcula a diferença
# A funç~

[1] 395

,
Exemplo 2.46. (Amplitude com valores negativos) Para calcular a amplitude do conjunto de dados 186,
402, −191, 20, 7 e 124 é preciso lembrar que na multiplicação “menos com menos dá mais”. Assim,

A = 402 − (−191) = 402 + 191 = 593.

> diff(range(c(186,402,-191,20,7,124))) # Funç~


oes aninhadas ('nested functions')

[1] 593

2.4.2 Variância
A variância é um tipo de média quadrática em relação à média, i.e., avalia o quanto, em média, os dados
variam ao quadrado em torno da média31 . As fórmulas da variância universal e amostral são dadas
respectivamente pelas equações (25) e (26).
PN PN
i=1 (xi − µ)2 x2i
σ2 = = i=1
− µ2 (25)
N N

Pn  Pn
− x̄)2 x2i
   
i=1 (xi n n
σ̂ 2 = s2n = = i=1
− x̄2 = σ2 (26)
n−1 n n−1 n−1

Note que a variância amostral é dividida por n − 1 e não por n. Intuitivamente pode-se pensar como
uma espécie de penalidade aplicada a esta medida quando observa-se apenas parte do universo (amostra).
Da mesma forma pode-se pensar na variância amostral como o produto entre a variância universal σ 2 e
o fator de correção n/(n − 1).
Exemplo 2.47. (Variância universal) A variância universal do conjunto de dados 186, 402, 191, 20,
7 e 124 é
Fórmula 1
P6
2 (xi − 155)2 (186 − 155)2 + (402 − 155)2 + · · · + (124 − 155)2 104356
σ = i=1 = = = 17392.6̄
6 6 6
Fórmula 2
1862 + 4022 + 1912 + 202 + 72 + 1242 248506
σ2 = − 1552 = − 24025 = 17392.6̄
6 6
31 Sugestão: leia isso pelo menos três vezes, devagar.

Page 31
DRAFT VERSION
> (var.p <- var(c(186,402,191,20,7,124))*(5/6)) # Vari^
ancia amostral*(1/fator de correç~
ao)

[1] 17392.67

,
Exemplo 2.48. (Variância amostral) A variância amostral do conjunto de dados 186, 402, 191, 20, 7
e 124 é
P6
(xi − 155)2 (186 − 155)2 + (402 − 155)2 + · · · + (124 − 155)2 104356
s26 = i=1 = = = 20871.2
6−1 6−1 5
Fórmula 2
1862 + 4022 + 1912 + 202 + 72 + 1242
  
6
s26 = − 1552 = 17392.6̄ × 1.2 = 20871.2
6 5

> (var.a <- var(c(186,402,191,20,7,124))) # 'var' calcula a vari^


ancia amostral

[1] 20871.2

Assim, se o conjunto de dados deste exemplo representar uma amostra observada em 6 vezes que se
contou o número de passos até a lixeira mais próxima na capital do Rio Grande (do Sul), pode-se dizer
que a variância amostral é 20871.2 passos2 . Dica: não tente interpretar este valor.
,
Como esperado, a variância amostral é maior do que a variância universal devido à penalidade n/(n −
1). Como exercı́cio, faça n = 6 e verifique que neste caso s2n é 20% maior que σ 2 . Perceba também
que calcular as variâncias pela P
Fórmula 2 é mais
Pn fácil se comparado à Fórmula 1. Isto ocorre pois
N
obter as médias quadráticas32 i=1 ix 2
/N e x
i=1 i
2
/n envolve menos operações do que para obter
PN 2
Pn 2
(x
i=1 i − µ) /N ou (x
i=1 i − x̄) /(n − 1).

2.4.3 Desvio Padrão


O desvio padrão é a raiz quadrada da variância. O motivo de calcular o desvio padrão é que a sua
interpretação é mais intuitiva se comparada à da variância, uma vez que a unidade de medida do des-
vio padrão é a mesma da variável X. As fórmulas do desvio padrão universal e amostral são dadas
respectivamente pelas equações33 (27) e (28).

σ = σ2 (27)

p
sn = s2n (28)

Exemplo 2.49. (Desvio padrão universal) Do exemplo 2.47 sabe-se que a variância universal do conjunto
de dados 186, 402, 191, 20, 7 e 124 é σ 2 = 17392.6̄. Assim, o desvio padrão universal é

σ = 17392.6̄ ≈ 131.88126.
32 Seção 2.3.7.
33 Se você ficou confuso com a notação, escreva σ 2 = V e σ = D (bem como s2 = v e s = d) e repense o problema. Vide
Seções 3.3.1 e 3.4.1 para definições mais gerais.

Page 32
DRAFT VERSION
> (dp.p <- sd(c(186,402,191,20,7,124)) * sqrt(5/6)) # s_n * raiz(1/fator de correç~
ao)

[1] 131.8813

> [Link](dp.p, sqrt(var.p)) # 'dp.p' é igual à raiz quadrada de 'var.p'

[1] TRUE

> [Link](dp.p^2, var.p) # 'dp.p' ao quadrado é igual a 'var.p'

[1] TRUE

,
Exemplo 2.50. (Desvio padrão amostral) Do exemplo 2.48 sabe-se que a variância amostral do conjunto
de dados 186, 402, 191, 20, 7 e 124 é s26 = 20871.2. Assim, o desvio padrão amostral é

s6 = 20871.2 ≈ 144.46868.

> (dp.a <- sd(c(186,402,191,20,7,124))) # 'sd' calcula o desvio padr~


ao amostral

[1] 144.4687

> [Link](dp.a, sqrt(var.a)) # 'dp.a' é igual à raiz quadrada de 'var.a'

[1] TRUE

> [Link](dp.a^2, var.a) # 'dp.a' ao quadrado é igual a 'var.a'

[1] TRUE

Assim, se o conjunto de dados deste exemplo representar uma amostra observada em 6 vezes que se
contou o número de passos até a lixeira mais próxima na capital do Rio Grande (do Sul), pode-se dizer
que o desvio padrão (amostral, claro) é de aproximadamente 144.5 passos. Pode-se pensar neste valor
como uma oscilação média aproximada em torno da média aritmética.
,

2.4.4 Coeficiente de Variação


O coeficiente de variação é uma medida de comparação de variabilidades, uma vez que ajusta o desvio
padrão pela média. É preferı́vel ao desvio padrão por ser um número adimensional, i.e., não possui
unidade de medida, tornando quaisquer conjuntos de dados comparáveis em termos de variabilidade.
É utilizado em diversas áreas da Estatı́stica, mas é popularmente conhecido como medida de risco em
carteiras de ativos.
As fórmulas do coeficiente de variação universal e amostral são dadas respectivamente pelas equações
(29) e (30).
σ
γ= (29)
µ

s
γ̂ = g = (30)

Exemplo 2.51. (Coeficiente de variação) Duas variáveis são obtidas em um certo experimento quı́mico.
A variável X é medida em microgramas e possui média de 0.0045 µg e desvio padrão de 0.0056 µg. A
variável Y é medida em mols e possui média de 3549 mols e desvio padrão de 419 mols. O coeficiente de
variação de X é dado por gX = 0.0056 419
0.0045 ≈ 1.24, e de Y por gY = 3549 ≈ 0.12. Portanto, como 1.24 > 0.12,
conclui-se que o conjunto de dados X varia mais do que Y.

Page 33
DRAFT VERSION
> mx <- 0.0045
> dx <- 0.0056
> round(gx <- dx/mx, 2) # Coeficiente de variaç~
ao de X

[1] 1.24

> my <- 3549


> dy <- 419
> round(gy <- dy/my, 2) # Coeficiente de variaç~
ao de Y

[1] 0.12

EXERCÍCIOS
1. (Adaptado de Pagano (2004)) Em uma investigação dos fatores de risco para doenças cardiovasculares, os nı́veis de
cotinina (produto metabólico da nicotina) foram registrados para um grupo de fumantes (F) e um grupo de não
fumantes (NF) em nanogramas por mililitro (ng/mL)34 . As distribuições de frequência estão na tabela abaixo

Nı́vel de cotinina (ng/mL) fF f rF fN F f rN F


0 ` 14 78 3300
14 ` 50 133 72
50 ` 100 142 23
100 ` 150 206 15
150 ` 200 197 7
200 ` 250 220 8
250 ` 300 151 9
300 + 412 11
Total 1539 3445

Complete a tabela acima e responda:


a) Qual o percentual de fumantes com nı́vel de cotinina até 14 ng/mL? E entre os não fumantes, qual é este percen-
tual?
b) Qual percentual de fumantes que possuem 100 ng/mL ou mais de cotinina?
c) Entre os não fumantes, qual o percentual de pessoas que tem entre 100 e 250 ng/mL de cotinina?
d) Qual o intervalo modal entre os fumantes? E entre os não fumantes? Interprete.
e) A mediana do nı́vel de cotinina está em qual intervalo para os fumantes? E para os não fumantes? Interprete.
f) Represente os dados utilizando o gráfico que você considerar mais adequado.

2. (Adaptado de Pagano (2004)) Questões para revisar os conceitos estudados:


a) O que são estatı́sticas descritivas?
b) Como os dados ordinais diferem dos nominais? Dê três exemplos de cada tipo.
c) Quais as vantagens e desvantagens de se transformar medidas contı́nuas em intervalos de classe?
d) Ao se construir uma tabela, quando é vantajoso usar frequências relativas em vez de absolutas?
e) O que são quartis de um conjunto de dados?
f) O que são média e mediana? Sob quais condições é preferı́vel usar cada uma?

3. Você está dirigindo em uma rodovia e observa que ultrapassa o mesmo número de automóveis que ultrapassam
você. Qual medida de tendência central melhor representa a velocidade que você está dirigindo, média ou mediana?
Explique o seu raciocı́nio.

4. Foram observadas as quantidades de fotocópias feitas por dois setores de uma empresa no primeiro semestre de 2010,
apresentadas na tabela abaixo.

Mês jan fev mar abr mai jun


Setor X 30 15 15 10 39 35
Setor Y 120 160 15 130 145 300

P6 P6 P6 P6
Sabendo que i=1 xi = 144, i=1 x2i = 4196, i=1 yi = 870, i=1 yi2 = 168150, calcule:
34 Um nanograma é um bilionésimo de grama. 1g = 109 ng, 1ng = 10−9 g.

Page 34
DRAFT VERSION
a) A média, mediana e moda do número de cópias de cada setor.
b) A amplitude, a variância e o desvio padrão amostrais do número de cópias de cada setor.
c) Em qual dos setores o número de cópias variou mais? Por quê?
d) Represente os dados utilizando o gráfico que você considerar mais adequado.

5. Você não sabe a nota da primeira prova (P1 ) de três avaliações realizadas no semestre passado. Sabendo que a
média das notas das três avaliações foi P̄ = 7.5 e que P2 = 5 e P3 = 9, qual a nota da avaliação que você perdeu?

6. Para aprimorar seu chimarrão, você decidiu medir a temperatura da água que estava utilizando durante as duas
últimas semanas. As temperaturas (em graus Celsius) observadas foram as seguintes:

Semana 1: 72.4 84.9 57.5 61.0 87.9 78.1 73.0


Semana 2: 76.3 80.0 74.1 67.0 83.2 83.0 58.0

a) Calcule a média e mediana da temperatura da água nos 14 dias.


b) Repita o item (a) para semana 1 e para semana 2 separadamente. Parece haver diferença na temperatura de uma
semana para outra?
c) Uma embalagem de erva mate aponta a temperatura 75 graus Celsius como ideal, sendo considerado bom o
chimarrão com água entre 65 e 85 graus. Acima deste intervalo o mate está quente demais (pelando) e abaixo é
considerado frio. Com essa informação, monte uma tabela de frequência para observar quantas vezes nessas duas
semanas o chimarrão ficou frio, bom ou muito quente para as semanas 1, 2 e durante os 14 dias.
d) A frequência em que o chimarrão estava na temperatura ideal foi diferente nas duas semanas? Comente os resul-
tados, explicando as diferenças de uma semana para outra.

7. (Adaptado de Anderson et al. (2007)) Milhões de norte-americanos levantam de manhã e realizam seu trabalho em
escritórios residenciais, comunicando-se com a empresa por meios eletrônicos. Coletou-se uma amostra da idade de
20 indivı́duos que trabalham em casa. As idades foram as seguintes:

18 54 20 46 25 48 53 27 26 37
40 36 42 25 27 33 28 40 45 25

a) Calcule a média, mediana e moda.


b) Calcule e interprete o primeiro quartil.
c) A mediana de idade do universo de todos os adultos é 35.5 anos (The World Almanac, 2004 ). Com esta infor-
mação, comente se as pessoas que trabalham em casa tendem a ser mais jovens ou mais velhas que a população de
todos os adultos.

8. (Adaptado de Anderson et al. (2007)) Em um teste automobilı́stico de quilometragem e consumo de gasolina, 13


automóveis foram testados na estrada, em um percurso de 482.8 quilômetros, em condições de dirigibilidade tanto na
cidade quanto na rodovia. Os dados apresentados a seguir foram registrados para o desempenho obtido em termos
de quilômetros por galão (equivalente a 3.78 litros).

Cidade (X): 26.07 26.81 25.58 23.17 21.24 24.62


27.03 25.74 25.91 24.62 24.46 24.62 25.74
Rodovia (Y ): 30.57 32.18 28.96 29.93 30.89 27.35
27.35 28.96 30.57 33.95 31.22 28.96 28.96

P13 P13 P13 P13


Dados i=1 xi = 325.61, i=1 x2i = 8184.513, i=1 yi = 389.85, i=1 yi2 = 11732.66,
a) Calcule a média, mediana e a moda b) Faça uma investigação sobre a possibilidade de diferença de consumo de
combustı́vel quando de dirige na cidade e na rodovia.

9. (Adaptado de Pagano (2004)) Um estudo foi conduzido comparando mulheres adolescentes que sofriam de bulimia
com mulheres adolescentes normais com composição corporal e nı́veis de atividade fı́sica similares. Abaixo estão as
medidas de consumo calórico, registrados em calorias por quilograma, para amostras de adolescentes de cada grupo.

Bulı́micas: 15.9 18.9 25.1 16.0 19.6 16.5 21.5 25.6 17.0 17.6 18.1 18.9
Saudáveis: 20.7 30.6 22.4 33.2 24.5 33.7 37.1 36.6 26.3 37.4 40.8 37.4

a) Obtenha e interprete o consumo calórico mediano, tanto para adolescentes bulı́micas quanto para saudáveis.
b) Calcule a média de cada grupo.
c) Qual grupo tem maior variabilidade nas medidas? Justifique.

Page 35
DRAFT VERSION
10. O Mini-Exame do Estado Mental (MEEM) é provavelmente um dos instrumentos mais utilizados mundialmente,
possuindo versões em diversas lı́nguas e paı́ses, validado inclusive para a população brasileira. Fornece informações
sobre diferentes parâmetros cognitivos, contendo questões agrupadas em sete categorias, cada uma delas planejada
com o objetivo de avaliar funções cognitivas especificas como a orientação temporal (5 pontos), orientação espacial
(5 pontos), registro de três palavras (3 pontos), atenção e cálculo (5 pontos), recordação das três palavras (3 pontos),
linguagem (8 pontos) e capacidade construtiva visual (1 ponto). O escore do MEEM pode variar de um mı́nimo de
0 ponto, indicando o maior grau de comprometimento cognitivo dos indivı́duos, até um total máximo de 30 pontos,
que corresponde à melhor capacidade cognitiva. Desta forma a pontuação é a soma dos pontos de cada categoria,
podendo assumir os valores 0, 1, . . . , 30, de onde calculam-se medidas como média e variância para avaliação dos
pacientes.
Foram avaliados dois grupos de 8 pacientes cada em relação ao MEEM, conforme a tabela abaixo.

i 1 2 3 4 5 6 7 8
MEEM G1 (xi ) 12 19 12 17 18 12 10 11
MEEM G2 (yi ) 30 22 27 21 19 18 19 21

P8 P8 P8 P8
Se i=1 xi = 111, i=1 x2i = 1627, i=1 yi = 177, i=1 yi2 = 4041, pede-se:
a) Classifique a variável MEEM.
b) A média, a mediana e a(s) moda(s) do MEEM de cada grupo.
c) A amplitude do MEEM de cada grupo.
d) A variância e o desvio padrão universais do MEEM de cada grupo.
e) A variância e o desvio padrão amostrais do MEEM de cada grupo.
f) Em qual dos grupos o MEEM variou mais? Justifique.

11. (Adaptado de ?) O Conselho Regional de Odontologia recomenda visitas periódicas ao dentista e, para orientar sua
campanha de divulgação, realizou uma pesquisa com 100 crianças. O número médio de visitas no último ano foi 0.5.
A mediana e a moda do número de visitas foram iguais a zero. Com base nestes dados, responda V para verdadeiro,
F para falso (corrigindo o que estiver errado) e NSA para sentenças que não se pode afirmar através das informações
fornecidas.
( ) Pelo menos 50 crianças não visitaram o dentista neste ano.
( ) Alguma criança fez mais de três visitas no último ano.
( ) Metade das crianças já foi ao dentista pelo menos uma vez.
( ) Uma criança pode ter ido ao dentista 80 vezes no ano.

Questões de Concursos

12. (Prova 1 - TRF 2005) Assinale a alternativa correta:


Sobre a moda de uma variável, é correto afirmar que:
(a) para toda variável existe uma e apenas uma moda.
(b) a moda é uma medida de dispersão relativa.
(c) a moda é uma medida não afetada por valores extremos.
(d) em distribuições assimétricas, o valor da moda encontra-se entre o valor da média e o da mediana.
(e) sendo o valor mais provável da distribuição, a moda, tal como a probabilidade, pode assumir valores somente no
intervalo entre zero e a unidade.

13. (Prova 1 TRF 2005) Assinale a alternativa correta:


Considere a seguinte distribuição das frequências absolutas dos salários mensais, em reais, referentes a 200 trabalha-
dores de uma indústria.

i Classes de Salários fi
1 400 ` 500 50
2 500 ` 600 70
3 600 ` 700 40
4 700 ` 800 30
5 800 ` 900 10
Total -

Sobre essa distribuição de salários é correto afirmar que:


(a) O salário modal encontra-se na classe de R$ 800 até R$ 900.
(b) O salário mediano encontra-se na classe de R$ 600 até R$ 700.
(c) O salário modal encontra-se na classe de R$ 600 até R$ 700.
(d) O salário modal encontra-se na classe de R$ 700 até R$ 800.
(e) O salário mediano encontra-se na classe de R$ 500 até R$ 600.

Page 36
DRAFT VERSION
14. (Exame Fundação Médica do Rio Grande do Sul - 2010) Considere uma amostra de 250 pessoas que sofreram
acidentes ofı́dicos35 . O resumo dos dados está nas tabelas abaixo. Para cada questão (1 e 2) existe somente uma
alternativa correta.

Idade # pessoas
6`8 1
8 ` 10 2
10 ` 12 7
12 ` 14 14
14 ` 16 31
16 ` 18 44
18 ` 20 72
20 ` 22 61
22 ` 24 18
Total 250
Moda: 19
Média: 17.8
Mediana: 18
Primeiro quartil: 16
Segundo quartil: 20
Desvio padrão: 3

Questão 1) A frequência relativa de pessoas com idade maior ou igual a 12 anos e menor que 18 anos que sofreram
acidentes ofı́dicos é igual a:
(a) 35.6%
(b) 38.4%
(c) 39.6%
(d) 58.8%
(e) 64.4%

Questão 2) Analise as alternativas abaixo:


I) Metade das pessoas da amostra apresentou idade menor ou igual a 18 anos.
II) Metade das pessoas da amostra apresentou idade entre 16 e 20 anos.
III) O coeficiente de variação foi de aproximadamente 16.8%.
Assinale a melhor opção de resposta.
(a) I (b) II (c) III (d) I e II (e) I, II e III

15. (CESGRANRIO - 2010 - Petrobrás/Administrador) Uma loja de conveniência localizada em um posto de combustı́vel
realizou um levantamento sobre o valor das compras realizadas pelos seus clientes. Para tal tomou uma amostra
aleatória de 21 compras, que apresentou o seguinte resultado:

i Valor i Valor i Valor


1 R$ 19.40 8 R$ 22.00 15 R$ 18.00
2 R$ 14.00 9 R$ 34.00 16 R$ 29.00
3 R$ 18.30 10 R$ 15.50 17 R$ 34.00
4 R$ 27.20 11 R$ 28.50 18 R$ 15.50
5 R$ 8.70 12 R$ 34.00 19 R$ 13.40
6 R$ 10.30 13 R$ 10.80 20 R$ 17.00
7 R$ 7.20 14 R$ 15.50 21 R$ 19.00

A mediana dessa série de observações é:


(a) 15.5 (b) 18.0 (c) 18.3 (d) 28.5 (e) 34.0

35 Picada de cobra.

Page 37
DRAFT VERSION
2.5 Outras medidas
2.5.1 Assimetria (ou Obliquidade)
Assimetria ou obliquidade é uma medida que avalia a assimetria de uma distribuição de frequência.
Existem diversas definições na literatura, das quais apresentam-se três alternativas.
1
Pn
m3 (xi − x̄n )3
g1 = 3/2 =  nP i=1 (31)
1 n 2 3/2

m2 n i=1 (x i − x̄ n )

3/2 1
Pn
− x̄n )3

n−1 m3 n i=1 (xi
b1 = g1 = 3 =h i3/2 (32)
n s 1
Pn 2
n−1 i=1 (x i − x̄ n )

r
n(n − 1) n2
G1 = g1 = b1 (33)
n−2 (n − 1)(n − 2)

> [Link](1); x <- rnorm(100) # Gerando 100 valores N(0,1) com semente fixa
> e1071::skewness(x, type = 1) # Definiç~
ao clássica de assimetria, Equaç~
ao (31)

[1] -0.0722319

> e1071::skewness(x, type = 2) # Utilizada no SAS, SPSS e Excel, Equaç~


ao (33)

[1] -0.07333656

> e1071::skewness(x, type = 3) # Padr~


ao do R, utilizada no MINITAB e BMDP, Equaç~
ao (32)

[1] -0.07115113

2.5.2 Curtose
A curtose é uma medida de achatamento de uma distribuição de frequência. Assim como na assimetria,
das diversas definições de curtose apresentam-se três alternativas.
1
Pn
m4 (xi − x̄n )4
g2 = 2 − 3 =  n Pni=1  −3 (34)
m2 1
(x − x̄ )2 2
n i=1 i n

2 1
Pn
− x̄n )4

1 m4 n i=1 (xi
b2 = (g2 + 3) 1 − −3= 4 −3= h i2 − 3 (35)
n s 1
Pn 2
n−1 i=1 (xi − x̄n )

[(n + 1)g2 + 6] (n − 1)
G2 = (36)
(n − 2)(n − 3)

> [Link](1); x <- rnorm(100) # Gerando 100 valores N(0,1) com semente fixa
> e1071::kurtosis(x, type = 1) # Definiç~
ao clássica de curtose, Equaç~
ao (34)

[1] 0.007653206

> e1071::kurtosis(x, type = 2) # Usada no SAS, SPSS e Excel, Equaç~


ao (36)

[1] 0.07053697

> e1071::kurtosis(x, type = 3) # Padr~


ao do R, usada também no MINITAB e BMDP, Eq. (35)

[1] -0.05219909

Page 38
DRAFT VERSION

EXERCÍCIOS
1. Em uma fábrica foram identificados e contabilizadas as cinco principais causas de defeitos em determinado processo,
conforme gráfico de Pareto abaixo.

> needs(qcc)
> defect <- c(80, 27, 66, 94, 33)
> names(defect) <- c("código preço", "data de agendamento", "código do fornecedor",
"número de rastreio", "part number")
> [Link](defect, ylab = 'Frequ^ encia de defeitos', ylab2 = 'Percentual acumulado',
main = 'Gráfico de Pareto para defeitos')

Pareto chart analysis for defect


Frequency [Link]. Percentage [Link].
número de rastreio 94.00000 94.00000 31.33333 31.33333
código preço 80.00000 174.00000 26.66667 58.00000
código do fornecedor 66.00000 240.00000 22.00000 80.00000
part number 33.00000 273.00000 11.00000 91.00000
data de agendamento 27.00000 300.00000 9.00000 100.00000

Gráfico de Pareto para defeitos

100%
300


250


75%
Frequência de defeitos

Percentual acumulado
200


50%
150
100


25%
50

0%
0

número de rastreio

código preço

código do fornecedor

part number

data de agendamento

a) Quais as causas que, somadas, representam 80% dos defeitos observados?


b) Quantos defeitos foram observados no total?
c) Veja ?[Link].

Page 39
DRAFT VERSION
2.6 Visualização
Visualização é o processo de representar informações ou idéias através de diagramas, gráficos e outros
métodos de apresentação visual. De um modo geral, as ferramentas de visualização devem ser claras para
o leitor, devendo-se evitar detalhes desnecessários. Um bom visualizador transmite a informação desejada
de forma clara, precisa e eficiente. Ao apresentar informação de maneira visual deve-se considerar que

• o olho humano não diferencia muitas tonalidades de cor, por isso é interessante trabalhar com
escalas em degradê, diferentes texturas e espessuras de linha
• para apresentar dados categóricos é interessante ordenar as categorias de forma intuitiva para
melhor apresentação
• deve-se evitar o agrupamento de dados contı́nuos em categorias
• é importante manter a notação coerente com o texto.

2.6.1 Gráfico de Setores (Pizza)


Em Inglês é conhecido como pie chart, ou gráfico de torta em tradução livre. Não sei por que mudam
os alimentos de uma lı́ngua para outra, mas em Português é conhecido popularmente como gráfico de
pizza. Para fazer um charme para o chefe, porém, recomenda-se a expressão gráfico de setores. A
idéia é desenhar setores (ou ‘fatias’, se não for para o chefe) proporcionais às frequências das categorias.
Seguindo a etiqueta da apresentação gráfica, recomenda-se a utilização deste tipo de gráfico para, no
máximo, dez categorias. Os gráficos da Figura 2.4 estão apresentados em sentido anti-horário iniciando
em 0o . Este é o padrão da maioria dos pacotes computacionais, mas se necessário pode-se inverter o
sentido e iniciar em qualquer ângulo.

Atendimentos em um guichê Atendimentos em um guichê

90 Seg 37.5% Seg


Ter Ter
Qua Qua
Qui Qui
Sex Sex

62 25.8%
13 5.4%

44 18.3%
31 12.9%

(a) Frequência (da classe) (b) Frequência relativa

Figura 2.4: Gráficos de setores

> atend <- c(90,62,31,44,13) # Número de atendimentos


> colors <- gray(0:4/4) # Cinco tons de cinza
> atend_temp <- round(atend/sum(atend) * 100, 1) # Calculando os percentuais
> atend_rel <- paste0(atend_temp, '%') # Adicionando '%'. Teste '?paste'
> par(mfrow=c(1,2)) # Criando janela gráfica 1x2
> # Frequ^
encia (da classe) e legenda
> e', col=colors, labels=atend, cex=1.6, [Link]=1.7)
pie(atend, main='Atendimentos em um guich^
> legend(.8, .9, c('Seg','Ter','Qua','Qui','Sex'), cex=1.3, fill=colors, [Link]='white')
> # Frequ^
encia relativa e legenda
> e', col=colors, labels=atend_rel, cex=1.6, [Link]=1.7)
pie(atend, main='Atendimentos em um guich^
> legend(.8, .9, c('Seg','Ter','Qua','Qui','Sex'), cex=1.3, fill=colors, [Link]='white')

Page 40
DRAFT VERSION
2.6.2 Gráfico de Barras e Colunas
O gráfico de barras é usualmente utilizado para apresentar dados classificados em categorias não ordena-
das. Barras retangulares de mesma largura são dispostas sobre as categorias com altura proporcional às
frequências ou outra medida associada com as categorias. Podem ser dispostas na horizontal ou vertical;
quando agrupadas desta última forma, chama-se gráfico de colunas. É um gráfico bastante versátil, pois
permite representar a informação de diversas maneiras, conforme Figura 2.5.

Custos pessoais Custos pessoais

800
internet
moradia

600
e. elétrica

Custo (R$)
400
aliment.
educação

200

0 200 400 600 800 0

Custo (R$) educação aliment. e. elétrica moradia internet

(a) Barra (b) Colunas

Placebo vs trat. Placebo vs tratamento


40

Nenhuma melhora
Nenhuma melhora Alguma melhora
25

Alguma melhora Plena melhora


Plena melhora
30

20
Frequência

Frequência

15
20

10
10

5
0

Placebo Tratamento Placebo Tratamento

(c) Colunas empilhadas (d) Colunas lado a lado

Figura 2.5: Gráficos de barras e colunas

> custos <- c(640, 760, 75, 100, 850) # Custos pessoais
> names(custos) <- c('alimentaç~
ao','educaç~
ao','e. elétrica','internet','moradia') # Nomeando
> barplot(custos, xlab='Custo (R$)', main='Custos pessoais', col= gray(0:4/4), [Link]=1.6, horiz=T)
> barplot(custos, ylab='Custo (R$)', main='Custos pessoais', col= gray(0:4/4), las=1, [Link]=1.6)
> trat <- table(Arthritis$Improved, Arthritis$Treatment) # Utilizando base de dados 'Arthritis'
> rownames(trat) <- c('Nenhuma melhora','Alguma melhora','Plena melhora') # Nome das linhas
> colnames(trat) <- c('Placebo','Tratamento') # Nome das colunas
> barplot(trat,main='Placebo vs trat.', ylab='Frequ^ encia', col=c('black','grey','white'), [Link]=1.6)
> legend(1.5, 40, rownames(trat), cex=1, fill=colors[c(1,3,5)], [Link]='white')
> barplot(trat, main='Placebo vs tratamento', ylab='Frequ^ encia', col=c('black', 'grey','white'),
[Link] = 1.6, beside = T)
> legend(5, 28, rownames(trat), cex=1, fill=colors[c(1,3,5)], [Link]='white')

Page 41
DRAFT VERSION
2.6.3 Histograma
O histograma é um gráfico de barras sem espaçamento utilizado para representar distribuições de frequên-
cia de variáveis contı́nuas. Apresenta-se a variável dividida em classes no eixo horizontal (x) e a frequência
de cada classe no eixo vertical (y). Os pacotes computacionais em geral definem o número de classes
pela regra de Sturges36 . É uma ferramenta básica de análise exploratória de dados para avaliar a disper-
são e forma dos dados, detectar valores atı́picos e sugerir modelos e transformações para análises mais
avançadas.
40

20
30

15
Frequency

Frequency
20

10
10

5
0

1.50 1.55 1.60 1.65 1.70 1.75 1.50 1.55 1.60 1.65 1.70

Altura (m) Altura (m)

(a) Amplitude de classes de Sturges (padrão do R) (b) Amplitude de classes de Freedman-Diaconis

9
8
6

6
Density

count
4

3
2
0

0
1.50 1.55 1.60 1.65 1.70 1.75
1.50 1.55 1.60 1.65 1.70 1.75
Altura (m) Altura (m)

(c) Ajustando densidade normal (d) Utilizando a biblioteca ggplot2

Figura 2.6: Histogramas

> attach([Link]('[Link] head = T))


> hist(altura, prob=F, right=F, breaks = 'sturges', main = '', xlab='Altura (m)', col='grey')
> hist(altura, prob=F, right=F, breaks = 'fd', main = '', xlab='Altura (m)', col='grey')
> hist(altura, prob=T, right = F, main = '', xlab='Altura (m)', col='grey', ylim = c(0,9))
> curve(dnorm(x, mean=mean(altura), sd=sd(altura)), col='blue', lwd=2, add=T) # Ajustando normal
> ggplot2::qplot(altura, geom = 'histogram', xlab = 'Altura (m)') # [Link]('ggplot2', dep=T)

36 Seção 2.2.3.

Page 42
DRAFT VERSION
2.6.4 Box plot
O box plot ou diagrama em caixa é um gráfico em formato retangular limitado pelo primeiro e terceiro
quartis, onde a linha central é a mediana37 . A distância entre os quartis é a amplitude interquartı́lica,
definida por AI = Q75 − Q25 e contempla 75% − 25% = 50% dos dados. Pontos que ultrapassam 1.5 vez
a amplitude interquartı́lica acima (abaixo) de Q75 (Q25 ) são chamados outliers.

Número de filhos Variável W


6 Máximo

8
5

4 6
Número de filhos

3 Q75
4 ●

2 Mediana

2
1 Q25

0 Mínimo 0

A B C
(n=50) (n=300) (n=150)

(a) Boxplot (b) Proporcional ao tamanho do grupo

Pontuação em um teste Pontuação em um teste

25
F

20
E

Outliers

15 D ●
Pontos

Pontos

C ●
10


B
5

A B C D E F 0 5 10 15 20 25

(c) Vertical (d) Horizontal

Figura 2.7: Box plots

> attach([Link]('[Link] head = T))


> boxplot(filhos, main='Número de filhos', ylab='Número de filhos', las=1, [Link]=1.6)
> [Link](1); y <- c(rpois(50, lambda=1.5), rnorm(300,4), (1:150)/17)
> x <- factor(c(rep('A',50), rep('B',300), rep('C',150) ))
> bp <- boxplot(y ~ x, varwidth = TRUE, las = T, main='Variável W', [Link]=1.6)
> mtext(paste('(n=', bp$n, ')', sep = ''), at = seq_along(bp$n), line =2, side = 1)
> boxplot(count ~ spray, data = InsectSprays, col = 'lightgray', main = 'Pontuaç~ao em um teste',
ylab = 'Pontos', xlab = 'Grupo', las = 1, [Link] = 1.6)
> boxplot(count ~ spray, data = InsectSprays, col = 'lightgray', main = 'Pontuaç~ao em um teste',
ylab = 'Pontos', xlab = 'Grupo', las = 1, [Link] = 1.6, horizontal = T)

37 Seção 2.3.9.

Page 43
DRAFT VERSION
2.6.5 Gráfico de Dispersão
O gráfico de dispersão apresenta a relação entre duas variáveis contı́nuas. O gráfico da Figura 2.8a sugere
que o rendimento dos carros avaliados cai conforme aumenta sua massa, o que é bastante intuitivo. Na
Figura 2.8b está um exemplo de matriz de dispersão, que consiste em um mosaico com gráficos de
dispersão de duas ou mais variáveis apresentadas simultaneamente. Note que o gráfico da Figura 2.8a
está replicado na primeira linha, última coluna da matriz. Seu inverso (Massa vs Rendimento) está na
última linha, primeira coluna. É uma ferramenta útil no ajuste dos modelos apresentados no Capı́tulo 5.

Rendimento (km/L) vs Massa (kg) Matriz de dispersão


1000 4000 7000 1000 2000

● ● ●

14
14 ●

●● ●

● ●●

● ● ●
● ● ●
● ● ●

8 10
● ● ●● ● ●
●● Rendimento ● ● ● ● ● ● ● ●●●● ●
●● ● ● ●
● ● ● ●
●● ●
● ●
● ● ● ● ●●
● ● ●
● ●● ●
● ● ● ●●● ● ● ● ●●
●● ●
● ● ●

6
● ● ●
12 ●● ●● ●●

● ●● ●●

7000

● ● ●

Rendimento (km/L)

● ● ●
●● ● ● ●● ● ● ● ●● ●

● ● ● ●●
● ● ● ●

4000
●●●
● Cilindrada ●
● ●

●●

10 ● ● ●
● ● ●● ● ●
● ●● ●●
● ●● ●● ● ● ●
●● ● ●● ● ● ●●● ●

1000
● ● ●
● ● ● ● ● ●● ●● ● ●●● ●
● ●

5.0
● ● ●

● ● ● ● ●
8 ● ●

● ●
● ●
● ●
●● ●

4.0
● ● ●
● ●● ● ●
● ● ●● ●
[Link]ão ● ●● ● ●
● ● ● ● ● ●● ● ● ● ●
● ●
● ● ●
● ● ●
● ● ● ●
● ● ●
● ● ●● ● ●● ● ● ● ●● ●

3.0
●●● ●●

● ●
● ●● ●●
● ● ● ● ● ● ● ●



6 ●
● ● ●●● ●
● ●

2000

● ● ●
● ● ● ● ● ● ● ●
● ●
●● ● ● ●● ●
● ●


●●●
●● ● ●●
● ●

●● ●





● ● ●
Massa
● ● ●●● ● ●● ● ● ●
● ● ●
1000

● ● ●
● ● ● ●● ● ●
● ●
● ● ●● ●●

● ●● ● ●

1000 1500 2000 2500


6 8 10 14 3.0 4.0 5.0

Massa do carro

(a) Gráfico de dispersão (b) Matriz de dispersão

Figura 2.8: Gráfico de dispersão

> attach(mtcars) # [Link]('mtcars', dep=T)


> Rendimento <- 0.42515199183708*mpg
> Massa <- 0.453592*wt*1000
> Cilindrada <- 16.387064*disp
> [Link]~
ao <- drat
> plot(Massa, Rendimento,
main="Rendimento (km/L) vs Massa (kg)",
xlab="Massa do carro",
ylab="Rendimento (km/L)", pch = 19, las = 1, [Link] = 1.6)
> pairs(~ Rendimento + Cilindrada + [Link]~
ao + Massa, data = mtcars,
main = 'Matriz de dispers~
ao', [Link] = 1.6)

EXERCÍCIOS
1. Leia o artigo disponı́vel em [Link]

2. Acesse o link [Link] e escolha pelo menos dois conjuntos de dados.

a) Descreva brevemente os conjuntos selecionados.


b) Crie visualizações para os conjuntos escolhidos, destacando pontos que considere relevante.
c) Envie os códigos e links para o professor.

EXERCÍCIOS EXTRAS
1. Em 2009, a Pesquisa de Informações Básicas Municipais do IBGE divulgou os seguintes resultados para o número
de municı́pios por faixa de população para a região Sul do Brasil.
Com base nesta informação, complete com V (verdadeiro) ou F (falso), corrigindo o que estiver errado:
( ) A região Sul possui 1188 municı́pios.

Page 44
DRAFT VERSION
População # municı́pios Prefeitos (♂) Prefeitas (♀)
Até 5 000 421 397 24
De 5 001 a 10 000 291 268 23
De 10 001 a 20 000 229 222 7
De 20 001 a 50 000 144 134 10
De 50 001 a 100 000 57 54 3
De 100 001 a 500 000 43 40 3
Mais de 500 000 3 3 -
Total 1188 1118 70

( ) Mais de 90% dos municı́pios possuem prefeitos do sexo masculino.


( ) Menos de 8% dos municı́pios com até 10 mil habitantes são administrados por mulheres.
( ) Entre municı́pios com prefeitos do sexo masculino, aproximadamente 4% deles possuem mais de 100 mil habi-
tantes.
( ) A mediana da população dos municı́pios está entre 20001 e 50000 habitantes.
( ) Aproximadamente 34% dos municı́pios administrados por mulheres possuem até 5 mil habitantes.

Page 45
DRAFT VERSION

“ Em um mundo governado pela incerteza,


o único caminho possı́vel é o da dúvida.
É preciso idolatrar a dúvida!”
∼ Antônio Abujamra, 2000

3 Probabilidade
“ ó sei que nada sei”, reagiu Sócrates ao pronunciamento do Oráculo de Delfos, que o apontara
S como o mais sábio de todos os homens 38
. No texto de Sheakspeare, Hamlet diz a seu colega de
Wittenberg: “There are more things in heaven and earth, Horatio, than are dreamt of in your philo-
sophy.”39 Em linha com estes pensadores, o autor considera razoável formalizar uma maneira de lidar
com as incertezas da vida, ainda que de forma idealizada.
Pense em quantas coisas você tem certeza absoluta. Absoluta. Ab-so-lu-ta. Pense agora que você
deve tomar uma decisão. Pode ser algo simples, como escolher entre um café ou uma água no avião. Por
mais banal que isso possa parecer, uma decisão deve ser tomada, mesmo que você resolva não aceitar
qualquer das sugestões da aeromoça. A pior coisa que pode acontecer é o café estar frio ou fora do ponto,
a água estar quente ou com um gosto ruim ou, caso tenha optado por não beber nada, você ficar com
sono ou sede. Porém, pode-se decidir por algo mais emocionante. Digamos que você é o responsável
por decidir entre o pedido de falência ou da continuidade da empresa da qual você faz parte do corpo
diretivo. Bem mais emocionante do que conversar com a aeromoça, mas idêntico em termos de método:
considerações foram feitas (seu paladar/sua estratégia de negócios), observações foram realizadas (o
cheirinho do café/análise de informações contábeis e de mercado) e uma decisão foi tomada (café, água
ou no, ¡gracias señorita! /falência ou continuidade da empresa).
Para auxiliar em decisões maiores como o exemplo descrito acima, utiliza-se o conceito de probabi-
lidade, definido neste texto como o grau de incerteza quantificado. Pode-se quantificar a incerteza de
diversas formas40 , e neste texto serão abordadas as probabilidades axiomática e frequentista. A pro-
babilidade axiomática é aquela da qual partimos por consenso, enquanto a probabilidade frequentista é
considerada o limite para o qual tende a frequência relativa da Equação (37) (página 50) sob certas
condições de regularidade.
Exemplo 3.1. (Probabilidade axiomática) Assume-se que uma moeda seja equilibrada, com probabilidade
50% de face cara ou coroa.
,
Exemplo 3.2. (Probabilidade frequentista) Uma moeda é lançada 100 vezes aproximadamente sob as
mesma condições e observa-se a frequência de faces cara e coroa. Se ao final dos n = 100 lançamentos
observarmos 54 caras e 100 − 54 = 46 coroas, calcula-se que há 54/100 = 54% de probabilidade de face
cara e 46/100 = 46% de coroa.
,
A seguir será feita uma breve revisão da Teoria dos Conjuntos, base para a compreensão do formalismo
da Teoria da Probabilidade.

3.1 Teoria dos Conjuntos


Um conjunto é uma coleção de elementos, sem repetição e não ordenada. Um subconjunto é uma
coleção de elementos que pertencem a um determinado conjunto. Formalmente não existe definição para
conjunto, subconjunto, elemento e pertinência, pois estas são consideradas noções primitivas 41 .
38 Stokes (1997).
39 Hamlet Ato 1, cena 5, 159–167.
40 Para mais detalhes sobre os tipos de probabilidade, vide Feller (1968); de Finetti (1974); James (2010).
41 Iezzi and Murakami (1977).

Page 46
DRAFT VERSION
Exemplo 3.3. (Conjunto, subconjunto e elemento) Suponha o conjunto T formado pelos alunos que
participam da seleção de truco da universidade. Pode-se anotar

T = {Aaron, Beatriz, Carlos, Denivaldo, Evelino, F abiane} = {A♂ , B♀ , C♂ , D♂ , E♂ , F♀ }.

Cada aluno jogador da seleção de truco é elemento de T . Pode-se dividir o conjunto T em dois subcon-
juntos,
T♂ = {A♂ , C♂ , D♂ , E♂ }
e
T♀ = {B♀ , F♀ }.
Os guris são elementos de T♂ e as gurias elementos de T♀ .
,

3.1.1 Relações
Seja A um conjunto e a um elemento de A. a ∈ A simboliza que a pertence ao conjunto A. Se um
elemento b não pertence ao conjunto A, anota-se b ∈
/ A. Diz-se que um conjunto A está contido em
outro conjunto B se todos os elementos pertencentes ao conjunto A também estiverem contidos em
B, simbolizado pelas relações A ⊂ B ou B ⊃ A. Estas relações também podem ser lidas como A é
subconjunto de B.
Exemplo 3.4. (Relações entre elementos e conjuntos) Suponha os conjuntos T , T♂ e T♀ definidos no
Exemplo 3.3.

Conjunto-conjunto Elemento-conjunto

T♂ ⊂ T Aaron ∈ T
T♂ ⊂ T Aaron ∈ T♂
T♀ ⊂ T Aaron ∈/ T♀
T 6⊂ T♂ F abiane ∈ T
T 6⊂ T♀ F abiane ∈
/ T♂
T♀ 6⊂ T♂ F abiane ∈ T♀

3.1.2 Conjunto Vazio


Conjunto vazio 42 é um conjunto sem elementos. Sua definição pode parecer um pouco estranha em
um primeiro momento, mas é de grande importância na Teoria de Conjuntos. Intuitivamente pode-se
pensar que alguns resultados são impossı́veis em certos experimentos, gerando a necessidade prática de
tal definição. É denotado por {} ou ∅, e não deve ser confundido com a letra grega φ. Por definição o
conjunto vazio é subconjunto de qualquer conjunto.
Exemplo 3.5. (Conjunto vazio) O conjunto dos possı́veis resultados de um lançamento de um dado é
Ω = {1, 2, 3, 4, 5, 6}. Como é impossı́vel obter um valor negativo como resultado, o conjunto em que se
obtém um valor negativo pode ser definido pelo conjunto vazio, i.e., Ω− = ∅.
,

3.1.3 Cardinal e Conjunto das Partes


O cardinal de um conjunto indica seu número de elementos. O cardinal do conjunto A é denotado por
|A|, onde |A| ∈ N. O conjunto das partes ou conjunto potência de um conjunto A é o conjunto contendo
todos os subconjuntos de A, denotado por P (A). Por definição o conjunto vazio ∅ é subconjunto de
P (A). O cardinal do conjunto das partes é dado por |P (A)| = 2|A| .
42 Há algum tempo era também referenciado como conjunto nulo, mas este termo atualmente designa uma definição

formal em Teoria da Medida, onde um conjunto nulo é tal que µ(φ) = 0.

Page 47
DRAFT VERSION
Exemplo 3.6. (Cardinal e conjunto das partes) Seja o conjunto A = {−9, 0, 5}. Sabe-se que
|A| = 3,
|P (A)| = 23 = 8
e
P (A) = {∅, {−9} , {0} , {5} , {−9, 0} , {−9, 5} , {0, 5} , {−9, 0, 5}} .
,

3.1.4 Operações
As operações com conjuntos são fundamentais na Teoria da Probabilidade. Deve-se diferenciar operações
entre conjuntos e operações entre números. União (∪), intersecção (∩) e complementar (Ac ) são operações
entre conjuntos. Adição (+), subtração (−) e multiplicação (×) são operações realizadas com números.
As operações com conjuntos possuem associação com as operações numéricas, detalhadas a seguir.
União ∪
A operação de união é representada pelo sı́mbolo ∪. Indica que o novo conjunto gerado deve considerar
todos os elementos dos conjuntos envolvidos na operação de união. Caso existam elementos iguais, eles
não devem ser repetidos. O diagrama de Venn 43 da Figura 3.1a representa graficamente esta operação.
Equivale em Português à palavra ‘ou’ e em Matemática à operação numérica de adição (+).
Exemplo 3.7. (União) Suponha os conjuntos T , T♂ e T♀ definidos no Exemplo 3.3.
T♂ ∪ T♀ = T,
T♂ ∪ T = T,
T♀ ∪ T = T.
,
Intersecção ∩
A operação intersecção é representada pelo sı́mbolo ∩. Indica que o novo conjunto gerado deve
considerar apenas os elementos que sejam comuns aos conjuntos envolvidos na operação de intersecção.
O diagrama de Venn da Figura 3.1b representa graficamente esta operação. Equivale em Português à
palavra ‘e’ e em Matemática à operação numérica de multiplicação (×).
Exemplo 3.8. (Intersecção de conjuntos disjuntos) Suponha os conjuntos T , T♂ e T♀ definidos no
Exemplo 3.3.
T♂ ∩ T♀ = {} = ∅,
T♂ ∩ T = T♂ ,
T♀ ∩ T = T♀ .
Pode-se visualizar estes conjuntos na Figura 3.1d, com k = 2.
,
Exemplo 3.9. (Equivalências da união) Retomando o Exemplo 2.1 da página 9, suponha que 32 torce-
dores do Maragato F.C. e 25 do Ximango F.C. estejam em uma sala de aula. Seja M o conjunto dos
torcedores do Maragato F.C. e X o conjunto dos torcedores do Ximango F.C., denotados por
M = {m1 , m2 , . . . , m32 }
e
X = {x1 , x2 , . . . , x25 }.
A união destes conjuntos é
M ∪ X = {m1 , m2 , . . . , m32 , x1 , x2 , . . . , x25 }.
Logo, existem |M ∪ X| = |M | + |X| − |M ∩ X| = 32 + 25 − 0 = 57 torcedores do Maragato F.C. ou do
Ximango F.C. na sala de aula.
,
43 O diagrama de Venn é uma representação gráfica de conjuntos através de cı́rculos ou outras formas.

Page 48
DRAFT VERSION
Exemplo 3.10. (Leitores de mais de um jornal) Suponha que existam 20 leitores de Diário Brotense
(D), 30 leitores de Meia Noite (M) e 6 leitores de Diário Brotense e de Meia Noite, denotados por

D = {d1 , d2 , . . . , d20 }

e
M = {m1 , m2 , . . . , m30 }.
A união D ∪ M possui |D ∪ M | = |D| + |M | − |D ∩ M | = 20 + 30 − 6 = 44 elementos, visto que 6 deles
estão simultaneamente em D e M . Visualize este exemplo na Figura 3.1a.
,
Exemplo 3.11. (Intersecção de conjuntos não disjuntos) Do Exemplo 3.10, a intersecção D ∩ M possui
6 elementos. Visualize este exemplo na Figura 3.1b.
,

Complementar

O complementar do conjunto A indica que o novo conjunto gerado deve considerar os elementos que
não pertencem a A, também chamados de não A ou ¬A. É representado pelas simbologias Ac e Ā. Neste
texto será adotada a notação Ac para não colidir com a média amostral, também anotada pelo sı́mbolo
de barra Ā. O diagrama de Venn da Figura 3.1d representa graficamente esta operação. Equivale em
Português à palavra ‘não’ e em Matemática à operação numérica de subtração (−).
Exemplo 3.12. (Complementar) Do Exemplo 2.1, M = X c e X = M c .
,

(a) A união B, ou A ∪ B (b) A intersecção B, ou A ∩ B

(c) Complementar de A, não A, ¬A ou Ac (d) Partição

Figura 3.1: Operações com conjuntos

Page 49
DRAFT VERSION
3.1.5 Conjuntos Disjuntos e Partição
Conjuntos disjuntos são aqueles cuja intersecção é o conjunto vazio, ou seja, não se sobrepõem. Uma
partição é uma quebra de um conjunto em subconjuntos disjuntos.
Exemplo 3.13. (Conjunto disjunto e partição) Do Exemplo 3.9, não existem pessoas que torçam para
o Maragato F.C. e para o Ximango F.C. simultaneamente. Os Maragatos e Ximangos formam uma
possı́vel partição do Rio Grande44 .
,

3.2 Definições
3.2.1 Experimento Aleatório
Um experimento aleatório é um processo no qual não se conhece o especı́fico resultado, mas se conhece o
conjunto dos possı́veis resultados. Um experimento aleatório pode ser medir alturas de mulheres, contar
o dinheiro que entra por dia em um supermercado ou simplesmente lançar um dado. É considerado
aleatório pois se desconhece o especı́fico resultado em cada realização, ainda que sejam conhecidos todos
os possı́veis resultados.

3.2.2 Espaço Amostral


O espaço amostral é o conjunto de todos os possı́veis resultados de um experimento aleatório, simbolizado
por Ω.

Exemplo 3.14. (Espaço amostral finito) No caso do experimento aleatório ‘lançar um dado’, o espaço
amostral é definido por
Ω = {1, 2, 3, 4, 5, 6} .
,
Exemplo 3.15. (Espaço amostral infinito) No Exemplo 2.9 da página 11, o espaço amostral é definido
pelo conjunto não enumerável Ω = {b ∈ R : 0 ≤ b ≤ 1}.
,

3.2.3 Evento
Em Probabilidade, um evento é um subconjunto do espaço amostral. Não confundir com eventos não-
probabilı́sticos como o Planeta Altlântida ou o show de aniversário da Rádio Farroupilha no anfiteatro
Pôr-do-Sol.

Exemplo 3.16. (Evento finito) Do Exemplo 3.14 pode-se estar interessado apenas nos resultados pares
do lançamento. Assim, o evento ‘face par’ pode ser descrito como E = {2, 4, 6} . Note que E ⊂ Ω.
,
Exemplo 3.17. (Evento infinito) Do Exemplo 3.15 pode-se estar interessado apenas nos locais onde
exista um percentual de bulı́micas superior a 8.4%. Assim, o evento ‘percentual de bulı́micas superior a
8.4%’ pode ser descrito como E = {b ∈ R : 0.084 < b ≤ 1}. Note que E ⊂ Ω.
,

3.2.4 Probabilidade
Atribui-se a probabilidade do evento A como
m
P r(A) = (37)
n
onde

• m é o número de casos favoráveis para o evento A


44 Do Sul.

Page 50
DRAFT VERSION
• n é o número possı́vel de casos

A probabilidade frequentista é o limite da Equação (37) quando n → ∞.

Exemplo 3.18. (Cálculo de probabilidade) Suponha que um dado seja lançado 150 vezes (a pessoa tem
uma vida fantástica, a ponto de ter tempo livre para fazer essa experiência), e observa-se a distribuição
dos lançamentos apresentada na Tabela 3.1.

Face 1 2 3 4 5 6 Total
Frequência 18 24 34 26 27 21 150

Tabela 3.1: Resultado de 150 lançamentos de um dado, feitos por um desocupado.

Assim, o espaço amostral é Ω = {1, 2, 3, 4, 5, 6} e podem-se calcular algumas probabilidades tais como
24
P r(F ace 2) = P r({2}) = = 0.16 = 16%,
150
24 + 26 + 21
P r(F ace par) = P r(F ace 2 ou f ace 4 ou f ace 6) = P r({2}∪{4}∪{6}) = ≈ 0.4733 = 47.33%,
150
71
P r(F ace ı́mpar) = 1 − P r(F ace par) = 1 − ≈ 0.5267 = 52.67%,
150
P r(F ace 2 e f ace 4 e f ace 6) = P r({2} ∩ {4} ∩ {6}) = P r(∅) = 0.

> m <- c(18,24,34,26,27,21)


> n <- sum(m)
> (p2 <- m[2]/n)

[1] 0.16

> (ppar <- sum(m[c(2,4,6)])/n)

[1] 0.4733333

> (pimpar <- 1-ppar)

[1] 0.5266667

3.2.5 Propriedades
Propriedades fundamentais (de Kolmolgorov)

• P1
0 ≤ P r(A) ≤ 1 (38)

• P2
P r(Ω) = 1 (39)

• P3 Se A1 , A2 , ..., Ak são conjuntos disjuntos45 , então

P r(A1 ∪ A2 ∪ . . . ∪ Ak ) = P r(A1 ) + P r(A2 ) + . . . + P r(Ak ) (40)

Propriedades secundárias

Das propriedades fundamentais resultam outras, apresentadas sem demonstração:


45 Seção 3.1.5.

Page 51
DRAFT VERSION
• P4
P r(A) + P r(Ac ) = 1 ⇔ P r(A) = 1 − P r(Ac ) (41)

• P5
P r(∅) = 0 (42)

• P6
P r(A ∪ B) = P r(A) + P r(B) − P r(A ∩ B) (43)

• P7
c
P r([A ∪ B] ) = 1 − P r(Ac ∩ B) (44)

• P8
c
P r([A ∩ B] ) = 1 − P r(Ac ∪ B) (45)

EXERCÍCIOS
1. Demonstre as propriedades P4 a P8.

3.2.6 Probabilidade Condicional


Probabilidade condicional é a probabilidade do evento A após observada a ocorrência de um evento B.
A probabilidade de A dado B é

P r(A ∩ B)
P r(A|B) = , P r(B) 6= 0 (46)
P r(B)
Analogamente
P r(A ∩ B)
P r(B|A) = , P r(A) 6= 0
P r(A)
As propriedades acima resultam no regra do produto, ou a probabilidade do evento intersecção:

P r(A ∩ B) = P r(A) · P r(B|A) = P r(B) · P r(A|B) (47)

Quando ocorre
P r(A) · P r(B)
P r(A|B) = = P r(A) (48)
P r(B)
é dito que A e B são independentes (A ⊥
⊥ B), uma vez que a observação de B não altera a opinião sobre
A. As propriedades de probabilidade continuam valendo, permitindo que façamos

P r(A|B) = 1 − P r(Ac |B). (49)


Exemplo 3.19. (Probabilidade condicional) Um dado equilibrado é lançado, e deseja-se observar o
evento A: ‘face 2’. A pessoa que lançou o dado também dá uma informação B: ‘a face é par’. Assim,
1
P r(B) = ,
2
1
P r(A ∩ B) = ,
6
1/6 1
P r(A|B) = = ,
1/2 3
1 2
P r(Ac |B) = 1 − = .
3 3
,

Page 52
DRAFT VERSION

EXERCÍCIOS
2. Refaça o Exemplo 3.19 considerando a informação C: ‘a face é ı́mpar’. Calcule:

a) P r(C)
b) P r(A ∩ C)
c) P r(A | C)
d) P r(Ac | C)

3.2.7 Teorema da Probabilidade Total e a Regra de Bayes


Considere uma partição conforme digrama de Venn da Figura 3.2.

Figura 3.2: Partição de tamanho k = 5.


P5
A1 , . . . , A5 formam uma distribuição de probabilidade, i.e., i=1 P r(Ai ) = 1. Pela Figura 3.2,
B= ∪5i=1 (Ai ∩ B) (50)
Teorema 3.1. (Teorema da Probabilidade Total) Seja uma sequência enumerável de eventos aleatórios
A1 , A2 , . . . , Ak , formando uma partição de Ω. Como as intersecções Ai ∩ B são mutuamente excludentes,
então de (40)
k
X
P r(B) = P r(Ai ∩ B) (51)
i=1
Aplicando (47), podemos escrever
X
P r(B) = P r(Ai ) · P r(B|Ai ) (52)
i
a
De (46) pode-se calcular a probabilidade de Ai dada a ocorrência de B por

P r(Ai ∩ B)
P r(Ai |B) = (53)
P r(B)
Aplicando (51) e (47),
P r(Ai ) · P r(B|Ai )
P r(Ai |B) = P (54)
j P r(Aj ) · P r(B|Aj )

Esta é a regra de Bayes, útil quando conhecemos as probabilidades condicionais de B dado Ai ,


mas não diretamente a probabilidade de B. Conhecida também como a probabilidade da causa dada a
consequência.
Exemplo 3.20. (Regra de Bayes) Suponha uma caixa com três moedas, duas honestas46 e uma com
duas faces cara. A probabilidade condicional de a moeda sorteada ter sido aquela com duas caras pode
ser calculada. Para isso pode-se definir A1 : ‘a moeda retirada é honesta’, A2 : ‘a moeda retirada tem
duas caras’ e B : ‘o resultado final é cara’ e aplicar a regra de Bayes, resultando em
1
P r(A2 ) · P r(B|A2 ) 3 ×1 1
P r(A2 |B) = = 2 1 1 = .
P r(A1 ) · P r(B|A1 ) + P r(A2 ) · P r(B|A2 ) 3 × 2 + 3 ×1 2
,
46 Termo 1
técnico indicando que cada moeda possui uma face cara e outra face coroa, ambas com probabilidade 2
de
ocorrência.

Page 53
DRAFT VERSION
3.3 Variáveis Aleatórias Discretas
Uma variável aleatória (v.a.) é uma transformação (função) de Ω em Rn . Isto significa que os resultados
dos experimentos aleatórios serão transformados em números. Suponha uma variável aleatória X. RX é
o conjunto de todos os possı́veis valores de X, denominado contradomı́nio. Ele pode ser considerado um
espaço amostral numérico obtido a partir de Ω. Uma variável aleatória discreta é aquela cujo conjunto
RX é finito ou infinito enumerável.

Exemplo 3.21. (Variável aleatória discreta) Suponha o lançamento de dois dados. O espaço amostral
deste experimento aleatório é Ω = {(1, 1), (1, 2), . . . , (1, 6), (2, 1), (2, 2), . . . , (6, 6)}, e |Ω| = 36. Suponha
que haja interesse na variável aleatória ‘soma dos pontos’, denotada por X. O conjunto dos possı́veis
valores de X é RX = {2, 3, . . . , 12} e |RX | = 11.
,

EXERCÍCIOS
1. Do Exemplo 3.21, obtenha p(x), x ∈ 2, 3, . . . , 12.

Seja X uma variável aleatória discreta, onde para cada ponto de RX associa-se uma (função de)
probabilidade ou distribuição de probabilidade p(xi ) = P r(X = xi ), satisfazendo p(xi ) ≥ 0 para todo i e
P|RX |
i=1 p(xi ) = 1.

Exemplo 3.22. (Probabilidade com v.a. discreta) Suponha dois lançamentos consecutivos de uma moeda
equilibrada. O espaço amostral é Ω = {HH, HT, T H, T T }, onde H representa resultado ‘cara’ e T ‘coroa’.
Se estivermos interessados na variável aleatória X: ‘número de caras’, o conjunto de interesse passa a
ser RX = {0, 1, 2}, onde o elemento 0 do conjunto RX equivale ao evento {T T }, 1 ao evento {T H, HT }
e 2 a {HH}. As probabilidades, por sua vez, são
1 1 1
p(0) = P r(X = 0) = P r({T T }) =
× = ,
2 2 4
   
1 1 1 1 2 1
p(1) = P r(X = 1) = P r({T H, HT }) = × + × = = ,
2 2 2 2 4 2
1 1 1
p(2) = P r(X = 2) = P r({HH}) = × = .
2 2 4
1 2 1
Note que P r(X = 0) + P r(X = 1) + P r(X = 2) = + + = 1.
4 4 4
,

3.3.1 Esperança e Variância


Esperança

A esperança 47 de uma variável aleatória discreta X é dada por


X
E(X) = x · p(x). (55)
x

A esperança de uma função g(X) é dada por


X
E(g(X)) = g(x) · p(x). (56)
x

Exemplo 3.23. (Esperança de v.a. discretas X e X 2 ) Do Exemplo 3.22 pode-se calcular


1 2 1
E(X) = 0 × + 1 × + 2 × = 1.
4 4 4
47 Esta é uma noção genérica da média aritmética simples, descrita na Seção 2.3.2.

Page 54
DRAFT VERSION
Este resultado era esperado dada a simetria da distribuição. A esperança de g(X) = X 2 é dada por
1 2 1 3
E(X 2 ) = 02 × + 12 × + 22 × = = 1.5.
4 4 4 2
,

Variância

A variância 48 de uma variável aleatória discreta X é dada por


2 2
V (X) = E([X − E(X)] ) = E(X 2 ) − [E(X)] . (57)
O desvio padrão de uma variável aleatória discreta X é dado por
p
D(X) = V (X). (58)
Exemplo 3.24. (Variância e desvio padrão de uma v.a. discreta) Do Exemplo 3.23 pode-se calcular
3 1
V (X) = − 12 = = 0.5
2 2
e

D(X) = 0.5 ≈ 0.7071.
,

3.3.2 Distribuições de probabilidade


Uma distribuição
P de probabilidade éR uma função que descreve probabilidades. Sempre maior que zero, se
discreta, x p(x) = 1, se contı́nua x f (x)dx = 1.
Algumas formas especiais são generalizações de certos tipos de problema, levando a soluções pa-
dronizadas. Uma vez identificada a classe do problema, informações chamadas parâmetros tornam a
distribuição de probabilidade completamente definida.
Exemplo 3.25. (Parâmetros) Na Equação (37) (pg. 50) está apresentado uma distribuição de probabi-
lidade bastante simples. Basta saber os parâmetros ‘número de casos favoráveis para A’ e ‘número total
de casos’ para calcular as probabilidades de interesse, conforme ilustrado no Exemplo 3.18.
,

3.3.3 Distribuição Binomial B(n, p)


Considere um único lançamento de uma moeda que resulta em cara (H) ou coroa (T ) 49 . Seja P r({H}) =
p e P r({T }) = 1−p. Este é um experimento de Bernoulli 50 . Suponha agora n lançamentos independentes
da mesma moeda. Este é um experimento binomial. Seja X o número de faces cara resultantes nos n
lançamentos independentes. X é uma variável aleatória (com distribuição) (de probabilidades) binomial
de parâmetros n e p, denotado por X ∼ B(n, p). A distribuição binomial é dada por
 
n x
p(x) = P r(X = x) = p (1 − p)n−x , (59)
x
onde n ∈ N, p ∈ [0, 1], x ∈ {0, . . . , n} e
   
n n n!
= = Cxn = (60)
x n−x x! (n − x)!
A esperança e variância são dadas por

E(X) = np (61)

V (X) = np(1 − p) (62)


48 Esta é a definição de variância populacional, descrita na Seção 2.4.2.
49 Do Inglês Head (cara) e Tail (coroa).
50 Pode ser referenciado também como ensaio de Bernoulli.

Page 55
DRAFT VERSION
Exemplo 3.26. (Binomial) Suponha n = 12 lançamentos de uma moeda com probabilidade p = 0.7 de
face cara. Assim,
X ∼ B(12, 0.7),
 
12
p(x) = P r(X = x) = 0.7x 0.312−x ,
x
E(X) = 12 × 0.7 = 8.4,
V (X) = 12 × 0.7 × 0.3 = 2.52,

D(X) = 2.52 ≈ 1.5875.
,

3.3.4 Distribuição Binomial Negativa BN (k, p)


Considere novamente o lançamento de uma moeda que resulta em cara (H) ou coroa (T ) onde P r({H}) =
p e P r({T }) = 1 − p. Seja X o número de lançamentos n realizados até atingir a k-ésima cara. X é
uma variável aleatória (com distribuição) (de probabilidades) binomial negativa de parâmetros k e p,
denotado por
X ∼ BN (k, p),
onde k ∈ N∗ , p ∈ [0, 1] e x ∈ {0, . . . , n}. A distribuição binomial negativa é dada por
 
x−k−1 x
p(x) = P r(X = x) = p (1 − p)k , (63)
x
onde    
x+k−1 x+k−1 (x + k − 1)!
= = Cxx+k−1 = (64)
x k−1 x! (k − 1)!
A esperança e variância são dadas por
pk
E(X) = , (65)
1−p
pk
V (X) = . (66)
(1 − p)2
Exemplo 3.27. (Binomial negativa) Suponha o lançamento de uma moeda com p = 0.7, até a obtenção
de k = 4 caras. Assim,
X ∼ BN (4, 0.7),
 
x+3
p(x) = P r(X = x) = 0.7x 0.34 ,
x
0.7 × 4
E(X) = = 9.3̄,
1 − 0.7
0.7 × 4
V (X) = = 31.1̄,
(1 − 0.7)2

D(X) = 31.1̄ ≈ 5.5777.

> p <- 0.7


> k <- 4
> (E <- p*k/(1-p))

[1] 9.333333

> (V <- p*k/(1-p)^2)

[1] 31.11111

> (D <- sqrt(V))

[1] 5.577734

Page 56
DRAFT VERSION
3.3.5 Distribuição Poisson P(λ)
Poisson (1837) abordou a distribuição que leva seu nome considerando o limite de uma sequência de
distribuições binominais conforme Equação (59), no qual n tende ao infinito e p tende a zero enquanto
np permanece finito igual a λ.
Considere um pedágio onde passam em média λ veı́culos por minuto. A v.a. discreta X: ‘número de
veı́culos por minuto’ tem distribuição Poisson de parâmetro λ, denotada por
X ∼ P(λ),
onde λ > 0 e x ∈ {0, 1, 2, . . .}. A distribuição de Poisson é dada por
e−λ λx
p(x) = P r(X = x) = (67)
x!
onde o número de Euler 51 tem valor aproximado e ≈ 2.71828182845905. A esperança e variância são
dadas por
E(X) = λ (68)

V (X) = λ (69)
Exemplo 3.28. (Poisson) Considere um pedágio onde passam em média λ = 2 veı́culos por minuto.
Assim,
X ∼ P(2),
e−2 2x
p(x) = P r(X = x) = ,
x!
E(X) = 2,
V (X) = 2,

D(X) = 2 ≈ 1.4142.
,

3.4 Variáveis Aleatórias Contı́nuas


Uma variável aleatória é dita contı́nua quando assume qualquer valor em um intervalo ou coleção de
intervalos.
Exemplo 3.29. (Variável aleatória contı́nua) Do Exemplo 2.1052 , Ω = {t ∈ R : 0 < t ≤ T }. Suponha
que esteja-se interessado em avaliar T : ‘idade de adultos entre 18 e 35 anos’. Pode-se representar
RT = {t ∈ R : 18 ≤ t ≤ 35}, sendo T uma variável aleatória contı́nua visto que |RT | = +∞.
,
Seja X uma variável aleatória contı́nua. Como não é possı́vel listar todos os elementos de RX , a
notação p(xi ) perde o sentido, visto não existir o i-ésimo valor xi . Assim, para tratar do cálculo de
probabilidades com variáveis aleatórias contı́nuas, será utilizado f (x) no lugar de p(xi ). Assim, para
cada ponto de RX associa-se uma (função) densidade (de probabilidade) (fdp) f (x), satisfazendo

f (x) ≥ 0, ∀ x (70)
Z
f (x) dx = 1 (71)
x
Z b
P r(a ≤ X ≤ b) = f (x) dx (72)
a
A (função de) distribuição (acumulada) F de uma v.a. contı́nua é definida como
Z x
F (x) = P r(X ≤ x) = f (t) dt (73)
inf x

Note que f (x) = F 0 (x), P r(X = x) = 0 e P r(X ≤ x) = P r(X < x).


51 Na literatura também pode ser conhecido como número de Napier, constante neperiana, entre outras formas.
52 Página 11.

Page 57
DRAFT VERSION
Exemplo 3.30. (Probabilidade com v.a. contı́nua) Suponha a v.a. X: ‘altura de pessoas da PUCRS’
com fdp
46875 2
f (x) = − (x − 3.36x + 2.36), x ∈ [1.00, 2.36] .
19652
Assim,

46875 1.72 2
Z
P r(1.45 ≤ X ≤ 1.72) = − (x −3.36x+2.36) dx = F (1.72)−F (1.45) ≈ 0.5441−0.2560 = 0.2881.
19652 1.45
,

3.4.1 Esperança e Variância


Esperança

A esperança de uma variável aleatória contı́nua X é dada por


Z
E(X) = x · f (x) dx (74)
x

A esperança de uma função g(X) é dada por


Z
E(g(X)) = g(x) · f (x) dx (75)
x

Exemplo 3.31. (Esperança de v.a. contı́nuas X e X 2 ) Do Exemplo 3.30 pode-se calcular


Z 2.36
46875
E(X) = − x (x2 − 3.36x + 2.36) dx = 1.68.
19652 1.00

Este resultado era esperado dada a simetria da distribuição (parabólica). Note que (1.00+2.36)/2 = 1.68.
A esperança de g(X) = X 2 é dada por
Z 2.36
2 46875
E(X ) = − x2 (x2 − 3.36x + 2.36) dx = 2.91488.
19652 1.00

Variância

A variância 53 de uma variável aleatória contı́nua X é dada por


2 2
V (X) = E([X − E(X)] ) = E(X 2 ) − [E(X)] .

O desvio padrão de uma variável aleatória discreta X é dado por


p
D(X) = V (X).

Exemplo 3.32. (Variância e desvio padrão de uma v.a. contı́nua) Do Exemplo 3.31 pode-se calcular

V (X) = 2.91488 − 1.682 = 0.09248

e

D(X) = 0.09248 ≈ 0.30411.
,
53 Esta é a definição de variância populacional, descrita na Seção 2.4.2.

Page 58
DRAFT VERSION
3.4.2 Distribuição Normal N (µ, σ 2 )
A distribuição normal ou gaussiana 54 é uma distribuição probabilı́stica que modela variáveis aleatórias
contı́nuas e aproximações de variáveis aleatórias discretas55 . É especificada ao definirem-se os parâmetros
média e variância. Não existe padrão na literatura quanto à notação, portanto neste material será
adotada a simbologia X ∼ N (µ, σ 2 ), indicando que a variável aleatória X possui (ou é aproximada pela)
distribuição normal com média µ e variância σ 2 .56 Sua função densidade é dada por
1 1 x−µ 2
√ e− 2 ( σ ) .
f (x|µ, σ) = (76)
σ 2π
A normal é uma curva simétrica em forma de sino centrada na média, conferindo alta probabilidade
de ocorrência de resultados em torno da média e baixa probabilidade nas caudas. A área sob a curva é
calculada a partir da Equação (76) e indica a probabilidade associada a certo intervalo de X. As áreas
são medidas em função de unidades de desvio padrão em relação à média, conforme Figura 3.3.

68.3%

95.4%

99.7%

−3 −2 −1 0 1 2 3
Desvio padrão

Figura 3.3: Probabilidades em função do desvio padrão em relação à média

A distribuição normal padrão é um caso especial da distribuição normal, na qual a média é zero e a
variância é 1, indicado por Z ∼ N (0, 1). Esta distribuição é tabelada57 , e sua densidade é dada por
1 1 2
f (z|0, 1) = φ(z) = √ e− 2 z (77)

Sua função distribuição (acumulada) é representada por
Z z
1 1 2
F (z|0, 1) = Φ(z) = P r(Z < z) = √ e− 2 t dt (78)
−∞ 2π
Exemplo 3.33. (Probabilidades em uma normal padrão) Suponha Z ∼ N (0, 1). Utilizando-se a tabela
de normal padrão da página 120, podem-se calcular algumas probabilidades relativas à Z, tais como

P r(Z < 1) = Φ(1) = P r(Z ≤ 1.00) = 0.8413 = 84.13%,

P r(Z > 1) = P r(Z ≥ 1.00) = 1 − P r(Z ≤ 1.00) = 1 − 0.8413 = 0.1587 = 15.87%,


P r(Z = 1.00) = 0,
P r(Z < 0.00) = Φ(0) = 0.5000 = 50%,
P r(−1.92 < Z < 0.33) = P r(Z < 0.33) − P r(Z < −1.92) = 0.6293 − 0.0274 = 0.6019.
,
54 Em homenagem ao seu criador, o matemático e fı́sico alemão Carl Friedrich Gauss.
55 O Teorema Central do Limite é o resultado teórico que permite o uso da normal em diversos casos práticos, apresentado
na Seção 3.4.3. Para maiores detalhes sugere-se James (2010) e Feller (1968).
56 Note que serão indicadas sempre média e variância, e não média e desvio padrão. Assim, X ∼ N (14, 4) equivale a

X ∼ N (14, 22 ), e indica que a v.a. X tem média 14 e variância 4 (ou desvio padrão 2).
57 Página 120.

Page 59
DRAFT VERSION
Estas probabilidades foram calculadas utilizando a tabela de normal padrão da página 120. Basta
procurar o quantil58 de interesse, por exemplo −1.92, na linha −1.9 coluna 2, onde encontra-se a proba-
bilidade associada 0.0274, i.e., a probabilidade de Z ser menor que −1.92. Como esta tabela é a única
tecnologia necessariamente disponı́vel ao longo de todo o curso, tratou-se P r(Z < −1.92) = 0.0274 como
o valor exato da probabilidade, e não P r(Z < −1.92) ≈ 0.0274.

Exemplo 3.34. (Quantis em uma normal padrão) Sabendo que Z ∼ N (0, 1), é possı́vel encontrar z
sabendo-se a probabilidade associada.

P r(Z < z) = 0.8413 ⇒ z = 1.00,

P r(Z > z) = 0.1587 ⇒ z = 1.00,


P r(Z < z) = 0.5000 ⇒ z = 0.00,
P r(Z < z) = 0.0274 ⇒ z = −1.92,
P r(−z < Z < z) = 0.9500 ⇒ z = 1.96.
,

Padronização / Normalização

Para encontrar os valores de z do Exemplo 3.34, deve-se consultar a tabela de normal padrão de dentro
para fora, i.e., procurar o valor mais próximo da probabilidade fornecida (e.g. 0.0274) dentro da tabela
e seguir para as bordas, onde na linha estão os valores do inteiro (−1) e da primeira decimal (9), e na
coluna o valor da segunda decimal (2), resultando no quantil z = −1.92.
Uma boa notı́cia é que pode-se recorrer à tabela de normal padrão para calcular probabilidades em
uma normal com qualquer média ou variância. A única relação a ser utilizada é
X −µ
Z= ⇔ X = µ + Zσ (79)
σ
apresentada no exemplo a seguir.
Exemplo 3.35. (Probabilidades em uma normal qualquer) Suponha que a variável aleatória X: ‘altura
das pessoas da PUCRS’ tenha distribuição normal com média 1.68m e desvio padrão 0.12m. Assim,
X ∼ N (1.68, 0.122 ). Podem-se calcular algumas probabilidades, tais como
 
X −µ 1.80 − 1.68
P r(X < 1.80) = P r < = P r(Z < 1.00) = 0.8413 = 84.13%,
σ 0.12
 
1.80 − 1.68
P r(X > 1.80) = 1 − P r Z < = 1 − P r(Z < 1.00) = 1 − 0.8413 = 0.1587 = 15.87%,
0.12
P r(X = 1.68) = P r(Z = 0.00) = P r(Y = y) = P r(Ξ = ξ) = 0,
 
1.68 − 1.68
P r(X < 1.68) = P r Z < = P r(Z < 0.00) = 0.5000 = 50%,
0.12
 
1.45 − 1.68 1.72 − 1.68
P r(1.45 < X < 1.72) = P r <Z< = P r(Z < 0.33)−P r(Z < −1.92) = 0.6029.
0.12 0.12
,
Combinação Linear
2
Se X ∼ N (µX , σX ), Y ∼ N (µY , σY2 ) e X ⊥
⊥ Y , então

W = aX + bY + c ∼ N (aµX + bµY + c, a2 σX
2
+ b2 σY2 ).
58 Nome técnico para os valores de z apresentados nos Exemplos 3.33 e 3.34.

Page 60
DRAFT VERSION
3.4.3 Teorema Central do Limite
O Teorema Central do Limite (TCL) é um dos principais resultados da Probabilidade. Ele mostra que,
sob certas condições razoavelmente alcançadas na prática, a soma ou média de uma sequência de variáveis
aleatórias independentes e identicamente distribuı́das (iid )59 têm distribuição aproximadamente normal.
Este resultado facilita a resolução de problemas, uma vez que a normal é tabulada em praticamente todos
os textos que envolvam Estatı́stica.

Teorema 3.2. (Teorema Central do Limite de Lindeberg-Lévy) Seja X1 , X2 , . . . , Xn uma sequência de


variáveis aleatórias iid com E(Xi ) = µ e V (Xi ) = σ 2 . Se n −→ ∞, então
Pn
i=1 xi − nµ x̄n − µ D
√ = √ −→ N (0, 1). (80)
σ n σ/ n
a
Barry James (James (2010)) sugere o uso da expressão ‘Teorema Central do Limite’ no lugar de
‘Teorema do Limite Central’, pois central é o teorema, não o limite. A origem da expressão é atribuı́da
a Pólya, ao se referir a ‘der zentrale Grenzwertsatz ’, i.e., o ‘central’ refere-se ao ‘teorema do limite’.
A Figura 3.460 mostra a convergência da soma dos pontos de um dado lançado n ∈ {1, 2, 3, 4, 5} vezes.

Figura 3.4: Convergência em lançamentos de um dado equilibrado.

59 Variáveis que apresentam mesma distribuição de probabilidade, inclusive com os mesmos parâmetros. Por exemplo,

imagine 12 lançamentos de uma moeda com p = 0.7 e 1 − p = 0.3. Cada lançamento é um ensaio de Bernoulli com
probabilidade de sucesso e fracasso iguais a 0.7 e 0.3, respectivamente.
60 [Link]

Page 61
DRAFT VERSION
3.4.4 Distribuição Qui-quadrado χ2 (ν)
A distribuição qui-quadrado, representada por χ2 é uma distribuição cuja obtenção foi motivada em
problemas envolvendo tabelas de frequência. Se X1 , X2 , . . . , Xν , com Xi ∼ N (0, 1) ∀ i ∈ {1, 2, . . . , ν},
então

Xi2 ∼ χ2ν (81)
i=1

onde ν representa o parâmetro dos graus de liberdade61 . A distribuição qui-quadrado é tabelada, exibindo
as probabilidades mais utilizadas na prática para diversos graus de liberdade. A Figura 3.5 apresenta os
nomogramas para a distribuição qui-quadrado sugeridos por Boyd (1965) e Smith (1972).

(a) Nomograma de Boyd (1965) (b) Nomograma de Smith (1972)

Figura 3.5: Nomogramas da distribuição χ2

61 Os graus de liberdade estão sendo tratados de forma discreta, mas podem ser utilizados de maneira contı́nua.

Page 62
DRAFT VERSION
3.4.5 Distribuição t (de Student) t(ν)
t ou tν é a distribuição de probabilidades da estatı́stica
Z
T =p (82)
χ2 /ν

onde Z é uma normal padrão e χ2 é uma qui-quadrado com ν graus de liberdade. O parâmetro ν indica
o número de valores que podem variar no cálculo de uma estatı́stica.

Exemplo 3.36. (Graus de liberdade) Suponha uma disciplina em que haja três provas valendo entre 0
e 10 pontos, todas de mesmo peso. A condição de aprovação é que a média seja igual ou superior a 7,
i.e., P1 + P2 + P3 ≥ 21. Se um aluno tem P1 = 5 e P2 = 7, ele obrigatoriamente deve obter pelo menos
21 − (5 + 7) = 9 pontos na P3 para conseguir a aprovação. Este é um problema com 3 − 1 = 2 graus de
liberdade.
,

Momentinho Cultural 3.1. (t de Lüroth) A distribuição t foi obtida por dois estatı́sticos em momentos
diferentes, movidos por problemas distintos. Lüroth derivou a distribuição t em um trabalho de 1876,
conectando a teoria clássica de erros com um resultado bayesiano62 . Já ‘Student’ (pseudônimo de William
Gosset) encontrou uma relação equivalente à de Lüroth enquanto estudava estimativas para a média
populacional em 1908. Atribui-se o desconhecimento de Gosset ao fato de o primeiro trabalho ter sido
publicado em uma revista de Astronomia. Até hoje a distribuição é conhecida popularmente como ‘t de
Student’.
ˇ “(
Tabela t
A tabela t exibe as probabilidades mais utilizadas na prática (.10 = 10%, .05 = 5%, .025 = 2.5% e
.01 = 1%) para diversos graus de liberdade. À medida que ν → ∞, verifica-se que t(ν) converge para
N (0, 1).

(a) Exemplo de tabela t (b) Gráfico de t

Figura 3.6: Uma tabela t

Exemplo 3.37. (Usando a tabela t) Da Figura 3.6a, P r(T > 2.353) = 0.05 para ν = 3. Porém, quando
é necessário avaliar uma probabilidade para valores não tabelados, pode-se encontrar intervalos tais como
0.025 < P r(T > 2.917) < 0.05 para ν = 3.
,
Nomogramas são estruturas gráficas que permitem rapidamente medir intervalos de probabilidades e
quantis da distribuição. Foram criados para fornecer resultados com precisão suficiente para decisões em
problemas aplicados. O princı́pio é bastante simples, bastando traçar uma linha conectando os valores
disponı́veis. Os demais valores ficam claros ao traçar a linha. Na Figura 3.7b há uma t com ν = 7 e
quantil t7 = 4, resultando em 0.1% < P r(T > 4) < 0.5% e P r(−4 < T < 4) = 99.5%. Experimente
resolver os exercı́cios deste livro através dos nomogramas, e encontre o que você melhor se adapta.

62 Pfanzagl and Sheynin (1996).

Page 63
DRAFT VERSION

(a) Nomograma de James-Levy (1956) (b) Nomograma de Stammberger (1967)

Figura 3.7: Nomogramas da distribuição t

3.4.6 Distribuição F (de Fisher-Snedecor) F(ν1 , ν2 )


A distribuição F (de Fisher-Snedecor) é a distribuição da estatı́stica

χ21 /ν1
F = (83)
χ22 /ν2

onde χ21 é uma distribuição qui-quadrado com ν1 graus de liberdade e χ22 é uma distribuição qui-quadrado
com ν2 graus de liberdade. Está tabelada nas páginas 123 a 127.

3.4.7 Distribuição Exponencial E(λ)


Considere novamente o pedágio descrito na Seção 3.3.5, onde passam em média λ veı́culos por minuto.
Pode-se inverter a leitura, colocando o tempo entre cada carro como a nova variável de interesse. Assim,
neste pedágio passa 1 carro a cada λ1 minutos. A variável aleatória contı́nua X: ‘tempo entre veı́culos’
tem distribuição exponencial de parâmetro λ, denotada por

X ∼ E(λ),

onde λ > 0 e x > 0. A função densidade exponencial é dada por

f (x) = λe−λx (84)

onde e é o número de Euler 63 de valor aproximado e ≈ 2.71828182845905. A função distribuição acumu-


lada é dada por
F (x) = P r(X ≤ x) = 1 − e−λx (85)
A esperança e variância são dadas por
1
E(X) = = λ−1 (86)
λ
1
V (X) = 2 = λ−2 (87)
λ
63 Na literatura também pode ser conhecido como número de Napier, constante neperiana, entre outras formas.

Page 64
DRAFT VERSION
Exemplo 3.38. (Exponencial) Considere um pedágio onde passam em média λ = 2 veı́culos por minuto.
Assim,
X ∼ E(2),
f (x) = 2e−2x ,
1
E(X) = = 0.5,
2
1
V (X) = 2 = 0.25,
2

D(X) = 0.25 = 0.5.
,

EXERCÍCIOS EXTRAS
1. Considere o experimento aleatório “observar o sexo de uma ninhada de cachorros com 3 filhotes”. Descreva o espaço
amostral.

2. Uma Universidade tem 10 mil alunos, dos quais 4 mil são considerados esportistas. Temos, ainda, que 500 alunos são
do curso de biologia diurno, 700 são da biologia noturno, 100 são esportistas e da biologia diurno, 200 são esportistas
e da biologia noturno. Um aluno é escolhido ao acaso. Calcule a probabilidade de este aluno:

a) Ser esportista.
b) Ser esportista e aluno da biologia noturno.
c) Não ser da biologia.
d) Ser esportista ou aluno da biologia.
e) Não ser esportista nem aluno da biologia.

3. Foi feito um levantamento e constatou-se que das um milhão e quatrocentas mil pessoas de Porto Alegre, 150 mil
leem Zero Hora (ZH), 120 mil leem Correio do Povo (CP) e 20 mil leem Zero Hora e Correio do Povo.

a) Se escolhermos uma pessoa ao acaso, qual a probabilidade de ela ler Zero Hora?
b) Se escolhermos uma pessoa ao acaso, qual a probabilidade de ela ler Zero Hora ou Correio do Povo?
c) Qual a probabilidade de uma pessoa não ler qualquer destes jornais?

4. Uma floricultura possui 120 arranjos de flores sempre em exposição. Destes arranjos, 30 possuem lı́rios, 50 possuem
rosas, e 40 possuem gérberas. 8 arranjos de flores são feitos com lı́rios e rosas, 10 têm lı́rios e gérberas, 15 gérberas e
rosas. 3 arranjos possuem os três tipos de flores. Você não sabia o que comprar de aniversário para sua mãe, então
decidiu entrar na floricultura e escolher ao acaso qualquer um destes arranjos.

a) Qual a probabilidade de você escolher um arranjo apenas com lı́rios?


b) Qual a probabilidade de o arranjo escolhido ter apenas um tipo de flor?
c) Qual a probabilidade deste arranjo possuir exatamente dois tipos de flores?

Dica: monte o Diagrama de Venn.

5. Um grupo de 60 adultos bebedores de cerveja foi selecionado para fazer parte de uma pesquisa sobre o efeito da
propaganda na escolha da marca. Para o experimento foram realizadas 3 festas: uma sem propagandas da Solar,
uma com poucas propagandas e outra com muitas propagandas desta cerveja. Foram anotados quantos adultos
escolheram a cerveja Solar em cada uma das festas. 12 pessoas escolheram Solar na primeira festa, 27 escolheram
na segunda e 41 na terceira festa. 8 pessoas escolheram Solar na primeira e segunda festa, 6 pessoas na primeira e
na terceira, 15 escolheram na segunda e na terceira. 5 pessoas gostam muito desta cerveja e a escolheram em todas
as festas.

a) Monte o Diagrama de Venn para o problema.


b) Seleciona-se um dos participantes ao acaso. Qual a probabilidade de essa pessoa ter escolhido Solar apenas na
primeira festa? E na última festa?
c) Um dos participantes da pesquisa disse que bebeu Solar na terceira festa. Qual a probabilidade desta pessoa
também ter escolhido esta cerveja na segunda festa?
d) Será promovido um grande festival (50 mil ingressos vendidos) para o mesmo público-alvo, com muitas propa-
gandas da Solar. Intuitivamente, quantas pessoas você espera que vão escolher beber esta cerveja?

6. Foi feito um levantamento sobre os usuários de cartão de crédito no Brasil, e concluiu-se que 55% utiliza a bandeira
Visa, 30% utiliza a MasterCard e 20% utiliza Visa e MasterCard.

a) Qual a probabilidade de uma pessoa utilizar Visa ou MasterCard?


b) Qual a probabilidade de uma pessoa não utilizar nenhum desses cartões?

Page 65
DRAFT VERSION
Perı́odo Sexo A favor da reforma Contra a reforma Sem opinião
Diurno Feminino 2 8 2
Diurno Masculino 8 9 8
Noturno Feminino 4 8 2
Noturno Masculino 12 10 1

Dica: ‘E’ ≡ ∩, ‘OU’ ≡ ∪, Ac ≡ Complementar de A.

7. A tabela a seguir apresenta a informações de alunos de uma universidade quanto às variáveis perı́odo, sexo, e opinião
sobre reforma agrária.
Determine a probabilidade de escolhermos:

a) Uma pessoa do sexo masculino.


b) Uma pessoa do sexo masculino e sem opinião sobre a reforma agrária.
c) Uma mulher contra a reforma agrária.
d) Um estudante do perı́odo noturno que seja a favor da reforma agrária.
e) Uma mulher sem opinião sobre a reforma agrária.

8. As preferências de homens e mulheres por estilo de filme alugados estão apresentadas na tabela a seguir.

Comédia Romance Policial Total


Homens 136 2 248 386
Mulheres 102 195 62 359
Total 238 197 310 745

Calcule a probabilidade de:

a) Uma mulher alugar um filme policial.


b) O filme alugado ser comédia.
c) Um homem alugar um romance.
d) O filme ser policial, dado que foi alugado por um homem.

9. “Please, die Ana (. . . )/And you’re my obsession/I love you to the bones” escreve Daniel Johns, vocalista da banda
australiana Silverchair, sobre sua batalha contra anorexia nervosa. Anorexia nervosa é uma disfunção alimentar
caracterizada por uma dieta hipocalórica e estresse fı́sico. Estima-se que 1% (0.01) da população mundial apresente
o quadro de anorexia (A), 5% (0.05) apresente o quadro de bulimia (B) – outro tipo comum de disfunção alimentar
– e 0.5% (0.005) de anorexia e bulimia (A ∩ B).

a) Qual a probabilidade de uma pessoa apresentar anorexia ou bulimia?


b) Qual a probabilidade de uma pessoa não apresentar nenhum destes quadros?
c) Em uma população de 1000 pessoas, em quantas delas espera-se observar apenas o quadro de bulimia?

10. A vovó chega para o netinho e pergunta: “querido, como é mesmo o nome daquele alemão que deixa a vovó louca?”.
E o netinho prontamente responde: “Alzheimer, vovó!”. A doença de Alzheimer é uma doença degenerativa, e foi
descrita pela primeira vez em 1906 pelo psiquiatra alemão Alois Alzeheimer. Abaixo estão dados64 a respeito do
sexo e idade de pacientes diagnosticados com esta severa doença no estado do Rio Grande do Sul.

Idade M F Total
Até 69 anos 6000 9000 15000
De 70 a 74 anos 16800 25200 42000
De 75 a 79 anos 25200 37800 63000
De 80 a 84 anos 27600 41400 69000
De 85 a 89 anos 24000 56000 80000
Acima de 90 anos 20700 48300 69000
Total 120300 217700 338000

Se uma pessoa é diagnosticada com Alzheimer no Rio Grande do Sul,

a) Qual a probabilidade de ser do sexo feminino?


b) Qual a probabilidade de ter menos de 69 anos?
c) Qual a probabilidade de ter entre 75 e 84 anos e ser do sexo masculino?
d) Sabendo que no Rio Grande do Sul há em torno de 10 milhões de pessoas, qual a probabilidade aproximada de
escolhermos uma pessoa com Alzheimer ao acaso que tenha mais de 80 anos do sexo masculino ou uma pessoa
entre 75 e 89 anos do sexo feminino?
64 Adaptado de Bermejo-Pareja F, Benito-León J, Vega S, Medrano MJ, Román GC (Janeiro de 2008).

Page 66
DRAFT VERSION
11. Investidores do sexo masculino e feminino foram entrevistados quanto ao tipo dos seus investimentos: poupança,
bolsa de valores e mercado imobiliário. Os dados desta entrevista estão na tabela abaixo.

Investimento M F
Poupança (PO) 350 370
Bolsa de valores (BV) 140 60
Mercado imobiliário (MI) 70 10

Se sortearmos uma pessoa aleatoriamente,

a) Qual a probabilidade de ser um homem?


b) Qual a probabilidade de ser um investidor de poupança?
c) Qual a probabilidade de ser do sexo feminino e investir na bolsa de valores?
d) Qual a probabilidade ser um investidor da bolsa de valores ou do mercado imobiliário?

12. Alunos da universidade A e B foram entrevistados a respeito de suas inclinações a respeito de três correntes de
pensamento que influenciaram a psicologia moderna. Os dados desta entrevista estão na tabela abaixo.

Corrente de pensamento A B Total


Psicodinâmica (P) 35 28 63
Comportamentista (C) 12 9 21
Humanista (H) 8 8 16
Total 55 45 100

Determine a probabilidade de escolhermos:

a) Uma pessoa da universidade A.


b) Uma pessoa com inclinação para a teoria Psicodinâmica.
c) Uma pessoa da universidade B com inclinação para a teoria Comportamentista.
d) Uma pessoa com inclinação para as teorias Comportamentista ou Humanista.

13. Uma fábrica possui três máquinas, A B e C. A máquina A produz 1% de itens defeituosos, a máquina B 2% e C
3%. Se um item defeituoso é encontrado em um processo em que a máquina A é responsável por 50% da produção,
seguida de B com 30% e C com 20%,

a) Qual a probabilidade de que o item tenha sido produzido pela máquina A?


b) Repita o item anterior para as máquinas B e C.

14. Considere o lançamento de três moedas equilibradas.

a) Descreva o espaço amostral Ω.


b) Determine o contradomı́nio RX da variável aleatória X: ‘número de caras’.
c) Obtenha p(0), p(1), p(2) e p(3).
d) Encontre E(X), E(X 2 ) e D(X).

15. Refaça o Exercı́cio 14 com P r({C}) = 0.7.

16. Refaça o Exercı́cio 14 com P r({C}) = p. Qual a distribuição de X?

17. Sabe-se que uma máquina produz itens independentemente, dos quais 1% são defeituosos. Se em um lote são
fabricados 20 itens, responda:

a) Qual a distribuição da variável X: ‘número de itens defeituosos’ ?


b) Qual o valor esperado do número de itens defeituosos neste lote?
c) Qual o desvio padrão do número de itens defeituosos neste lote?
d) Qual a probabilidade de que sejam produzidos 6 itens defeituosos?
e) Qual a probabilidade de haver pelo menos um item defeituoso neste lote?

18. Por uma porteira passam em média 4 carretas65 por dia.

a) Qual a distribuição da variável X: ‘número de carretas por dia’ ?


b) Obtenha E(X) e D(X).
c) Qual a probabilidade de passar ao menos uma carreta neste intervalo?

1
19. Seja uma v.a. contı́nua X com fdp f (x) = (x3 − 3.36x + 2.36), x ∈ [1, 2] .
1.07

Mostre que 12 f (x)d(x) = 1.


R
a)
b) Obtenha F (x) = P r(X < x).
c) Calcule P r(1.4 < X < 1.7).
d) Encontre E(X), E(X 2 ) e D(X).
65 [Link]

Page 67
DRAFT VERSION
20. Seja uma v.a. contı́nua X com fdp f (x) = c [ln(x) − 2x + 10], x ∈ ]0, 1] .

a) Encontre c.
b) Obtenha F (x) = P r(X < x).
c) Calcule P r(X > 0.2).
d) Encontre E(X), E(X 2 ) e D(X).
R
Dica 1: x f (x)d(x) = 1.
R
Dica 2: ln(x)d(x) = xln(x) − x.

xk+1 xk+1
xk ln(x)d(x) =
R
Dica 3: ln(x) − .
k+1 (k + 1)2

21. Seja X uma v.a. contı́nua tal que X ∼ χ212 . A partir da Tabela de Qui-quadrado da página 102, obtenha:

a) P r(X > 4.40).


b) P r(X < 4.40).
c) A melhor aproximação ou intervalo para P r(X > 5).
d) A melhor aproximação ou intervalo para P r(X < 10).

22. Seja T uma v.a. contı́nua tal que T ∼ t5 . A partir da Tabela t da página 101, obtenha:

a) P r(T > 0.727).


b) P r(T < 4.032).
c) t, se P r(T > t) = 0.025.
d) A melhor aproximação ou intervalo para P r(T > 5).
e) O que você percebe quando ν → ∞?

23. Seja F uma v.a. contı́nua tal que F ∼ F (10, 6). A partir das Tabelas F das páginas 123 a 127, obtenha:

a) P r(F > 2.461).


b) f , se P r(F < f ) = 0.975.

24. Considere os dados do Exercı́cio 18 e a variável Y : ‘Tempo entre as carretas que cruzam a porteira’.

a) Qual a distribuição de Y ?
b) Determine f (y) e F (y).
c) Calcule E(Y ) e D(Y ). Interprete.
d) Calcule P r(Y < 1). Interprete.

25. Suponha que a idade de pessoas depressivas que cometeram suicı́dio (X) siga uma distribuição normal de média 32
anos e variância 72 anos2 .

a) Qual a probabilidade de uma pessoa depressiva de mais de 40 anos cometer suicı́dio?


b) Qual a probabilidade de uma pessoa depressiva entre 20 e 40 anos cometer suicı́dio?
c) Qual a probabilidade de uma pessoa depressiva menor de idade cometer suicı́dio?
d) Se P r(X < x) = 0.1038, qual o valor de x?
e) Interprete o valor de x no contexto do problema.

26. A idade de pessoas que pedem financiamentos de automóveis (X) segue uma distribuição normal com média 37 anos
e variância 62 anos2 , denotada por X ∼ N (37, 62).

a) Em um grupo de pessoas que pedem financiamento, qual a probabilidade de uma pessoa ter mais de 43 anos?
b) Neste mesmo grupo, qual a probabilidade de uma pessoa ter idade entre 32 e 45 anos?
c) Se P r(X < x) = 0.6217, qual o valor de x?
d) Interprete o valor de x no contexto do problema.

27. A duração da carga de uma máquina de fotocópias pode ser modelada como normal de média 15 e desvio padrão 2
(em milhares de cópias). Qual a probabilidade de a carga durar:

a) Menos de 16 mil cópias?


b) Mais de 13 mil cópias?
c) Entre 12 e 14 mil cópias?

28. As geladeiras produzidas por uma fábrica possuem um determinado tempo de vida até o primeiro estrago. Estudos
apontam que este tempo segue distribuição normal com média 8.7 anos e desvio padrão igual a 1 ano.

a) Qual a probabilidade de uma geladeira apresentar uma falha nos primeiros 7 anos de uso?
b) Qual a probabilidade de uma geladeira falhar entre o oitavo e o décimo anos de uso?
c) Qual a probabilidade de uma geladeira durar 12 anos sem apresentar falhas?
d) A fábrica oferece garantia de 6 anos. Qual a probabilidade de uma geladeira estragar neste perı́odo?
e) Qual a probabilidade de uma geladeira estragar fora da garantia?
f) Se a fábrica produziu 80 mil geladeiras, quantas pessoas devem acionar a garantia?

Page 68
DRAFT VERSION
29. O atendimento dos caixas de um determinado banco fica sobrecarregado entre o primeiro e o décimo dia do mês.
Neste perı́odo, o tempo de espera do caixa convencional tem distribuição normal com média de 23 minutos e desvio
padrão de 4 minutos. Para o caixa prioritário, este tempo distribui-se com média de 15 minutos e desvio padrão
igual a 3.

a) No caixa convencional, qual a probabilidade de você esperar mais de 20 minutos para ser atendido? E no caixa
prioritário?
b) Você leva em torno de meia hora para ler o caderno de esportes do jornal. Qual a probabilidade de você terminar
a leitura enquanto espera na fila do caixa? Faça as contas para ambos os caixas e compare.
c) Uma vovó de 90 anos chegou no banco. Qual a probabilidade de ela esperar entre 20 e 25 minutos para ser
atendida?
d) Há uma grande placa indicando que o tempo de espera máximo é de 12 minutos para os clientes preferenciais e
18 minutos para os demais clientes. Com que frequência as pessoas esperam mais do que este tempo para serem
atendidas?
e) Você foi chamado para corrigir este tempo máximo. A orientação é que apenas 10% dos clientes sejam atendidos
em um tempo maior que o indicado. Qual deveria ser o novo tempo para o caixa preferencial? E para o caixa
convencional?

30. Em um concurso estão inscritas 1000 pessoas para 150 vagas. As notas das provas seguiram distribuição normal
com média 6.2 e desvio igual a 1.

a) Selecionando ao acaso um candidato, qual a probabilidade de ele ter tirado menos que 5 na prova?
b) Qual a probabilidade de um candidato ter notas entre 5 e 6?
c) Aproximadamente quantas pessoas tiraram notas entre 5 e 7?
d) Alguém que tirou 8.4 na prova será aprovado no concurso? Qual a nota mı́nima para obter a aprovação?

31. O lucro lı́quido de uma loja (X) segue uma distribuição normal com média 15 mil reais e variância 70 mil reais2 ,
denotado por X ∼ N (15000, 70000).

a) Qual a probabilidade de o lucro lı́quido ser maior que 20 mil reais?


b) Qual a probabilidade de o lucro lı́quido estar entre 13 mil e 22 mil reais?
c) Qual a probabilidade de a loja dar prejuı́zo?

Questões de Concursos

32. (CESGRANRIO - 2010 - Petrobrás/Administrador) Em um posto de combustı́veis entram, por hora, cerca de 300
clientes. Destes, 210 vão colocar combustı́vel, 130 vão completar o óleo lubrificante e 120 vão calibrar os pneus.
Sabe-se, ainda, que 70 colocam combustı́vel e completam o óleo; 80 colocam combustı́vel e calibram os pneus e 50
colocam combustı́vel, completam o óleo e calibram os pneus. Considerando que os 300 clientes entram no posto
de combustı́veis para executar uma ou mais das atividades acima mencionadas, qual a probabilidade de um cliente
entrar no posto para completar o óleo e calibrar os pneus?

a) 0.10
b) 0.20
c) 0.25
d) 0.40
e) 0.45

33. (FMP-RS 2011 - TCE-RS - Auditor Público Externo/Administração) Dois professores corrigem a prova de redação
de um concurso público. O professor A corrige o dobro de provas do que o professor B. Sabe-se que 60% das provas
corrigidas pelo professor A tiveram nota superior a 7, enquanto apenas 20% das provas corrigidas pelo professor B
tiveram nota superior a 7. Se um candidato teve conceito não superior a 7, a probabilidade de sua prova ter sido
corrigida pelo professor A é:

a) 0.85571
b) 0.75000
c) 0.33333
d) 0.50000
e) 0.25000

34. (FEPESE - 2010 - SEFAZ-SC - Auditor Fiscal da Receita Estadual) Sejam dois eventos, A e B, mutuamente
exclusivos. A probabilidade de ocorrência de A vale 0.2. A probabilidade de ocorrência de B vale 0.4. Quanto vale
a probabilidade de ocorrência do evento A união B?

a) 0.08
b) 0.40
c) 0.48
d) 0.52
e) 0.60

Page 69
DRAFT VERSION

“ O saber deste mundo inferior,


dize tu, amigo: é falso ou verdadeiro?
Falso, que mortal o desejaria conhecer?
Verdadeiro, que mortal jamais o conheceu?”
∼ Antigo aforismo

4 Inferência Estatı́stica Clássica


iência é uma corrente filosófica que estuda universos através do Método Cientı́fico (M C 2 ).
C Tal método norteia a criação de hipóteses e etapas replicáveis para obter informações66 e ordenar
tais hipóteses. Cientista é, portanto, qualquer indivı́duo que formule hipóteses e descreva seu método de
captura de informação de forma mı́nima, possibilitando a validação por qualquer interessado. Quanto
mais simples for a metodologia, maior será o número esperado de interessados validando a teoria por si
próprios.
Inferência Estatı́stica é um ramo importante do Método Cientı́fico, que embasa a tomada de decisão.
Pelo paradigma clássico, ampliam-se as conclusões para conjuntos maiores a partir de conjuntos menores.
Conjuntos maiores são usualmente denominados universos, e conjuntos menores são amostras. Em geral
supõe-se o interese em algum estado ou quantidade universal desconhecido, geralmente denominado θ.
Para reduzir a ignorância sobre θ, observa-se uma amostra de tamanho n ∈ N.
Exemplo 4.1. (Tornando θ visı́vel) Você pega uma moeda pela primeira vez e se pergunta: “Esta moeda
é equilibrada?” Isto ocorre quando a probabilidade de face cara é de 50%. Simbolicamente, θ = 0.5.
,

Exemplo 4.2. (Observando amostras) Para atualizar a opinião sobre θ, a probabilidade de face cara
do Exemplo 4.1, podem-se observar amostras. Se lanço a moeda n = 25 vezes sob certas condições de
estabilidade e observo m = 11 caras,
11
θ̂ = = 0.44
25
A partir deste resultado você apostaria que a moeda é equilabrada (θ = 0.5) ou não equilibrada (θ 6= 0.5)?
Qual a distância máxima você admite de θ̂ para 0.5, de forma a aceitar θ = 0.5? Você altera sua decisão
para n = 100?
,
As questões colocadas nos Exemplos 4.1 e 4.2 são estudadas por duas grandes escolas de Inferên-
cia Estatı́stica: Clássica 67 e Bayesiana. Ambas possuem metodologias para captura de informação a
respeito de θ, mas divergem sobre alguns princı́pios. Dentre as principais divergências está o princı́pio
da verossimilhança, violado por clássicos, defendido pelos bayesianos. Tal princı́pio afirma que se dois
decisores possuem o mesmo grau de conhecimento e a mesma informação sobre θ, ambos devem decidir
exatamente da mesma forma a respeito de θ.
Exemplo 4.3. (Princı́pio da Verossimilhança 1) Considere uma sucessão de lançamentos de uma moeda,
independentes e condicionados por θ, a probabilidade de sair ‘cara’. Suponha que seja obtido o resultado

x = {H, T, H, H, T, T, H, T, T, T },
68
onde H: ‘cara’ e T : ‘coroa’ . Este resultado poderia ser obtido de diversos processos experimentais ou
regras de parada, como
66 Segundo Basu e Ghosh (1988), pg. 21, informação é aquilo que muda a sua opinião (sobre θ).
67 Também conhecida como Frequentista.
68 Do Inglês Head (cara) e Tail (coroa).

Page 70
DRAFT VERSION
• realizar 10 lançamentos, fixados a priori
• lançar a moeda até aparecerem 6 ‘coroas’
• lançar a moeda até aparecerem 3 ‘coroas’ consecutivas
• lançar a moeda até o jogador ficar saturado, tendo a saturação ocorrido no 10º lançamento
6
Em qualquer caso a (função de) verossimilhança é proporcional a θ4 (1 − θ) , i.e., a amostra informa
quatro sucessos (caras) e seis fracassos (coroas). Assim, adotando-se o princı́pio da verossimilhança, toda
a informação que x pode fornecer sobre θ encontra-se nesta expressão. Saber qual dos quatro processos
experimentais foi utilizado (cada um com um espaço amostral diferente) ou saber qual foi a regra de
parada adotada nada tem a acrescentar. Note que a possibilidade de o experimentador parar por seu
arbı́trio ao considerar o resultado x satisfatório, em nada altera a opinião sobre θ.
,

Apesar de mais ampla e intuitiva, a Inferência Bayesiana não se aplica de forma tão imediata devido
a limitações de software e pela necessidade de operações matemáticas mais sofisticadas como otimização
e integração de funções. Assim, será feito uso de métodos da HInferência ClássicaI, largamente aplicados.
Para maiores informações sobre métodos bayesianos, vide Paulino et al. (2003), Gelman et al. (2003) e
DeGroot and Schervish (2002). Para uma visão mais teórica, sugere-se de Finetti (1974).

EXERCÍCIOS
1. Realize o experimento do Exemplo 4.2 e estime θ.

4.1 Universo e Amostra


Universo ou população é o conjunto de todas as entidades (pessoas, animais, objetos) portadoras das
caracterı́sticas de interesse, mas raramente observado em sua plenitude. Amostra é um subconjunto
do universo, obtido a partir de algum método de seleção69 . As medidas avaliadas nos universos são
parâmetros, simbolizados por letras gregas. As medidas avaliadas na amostra são estatı́sticas, simboli-
zadas por letras do nosso alfabeto ou pelo parâmetro correspondente com o sı́mbolo ˆ (chapéu).

Média Variância Desvio Proporção Correlação Coeficiente


Padrão
√ (Percentual) Angular
θ Parâmetro (Universo) µ σ2 σ = σ√2 π ρ β1
θ̂ Estatı́stica (Amostra) x̄ = µ̂ s2 = σ̂ 2 s = σ̂ = s2 p = π̂ r = ρ̂ β̂1

Tabela 4.1: Alguns parâmetros e estatı́sticas

4.1.1 N en
N usualmente expressa o tamanho do universo em estudo, podendo ser considerado infinito. n é a
representação usual do tamanho da amostra. Na prática usualmente observam-se tamanhos de amostra
muito inferiores aos dos universos, simbolizado por n << N .
Exemplo 4.4. (n e N ) Se for realizada uma pesquisa com o intuito de avaliar o percentual de alunos
que apreciam música clássica, pode-se dizer que serão entrevistados n de um total de N alunos, onde
n << N . Como exercı́cio, releia a frase anterior trocando n por 50 e N por 30 mil.
,
69 Seção 4.2.

Page 71
DRAFT VERSION

Figura 4.1: Relação entre universo e amostra

4.1.2 Cálculo do tamanho da amostra


O cálculo do tamanho de amostra é baseado em uma série de premissas assumidas pelo pesquisador.
Os valores sugeridos pelos diversos métodos de cálculo de tamanho de amostra devem ser considerados
apenas como uma referência, dada a arbitrariedade das medidas utilizadas em sua obtenção.
Exemplo 4.5. (Tamanho da amostra) Em uma pesquisa eleitoral deseja-se calcular o tamanho de amos-
tra aproximado para que a margem de erro seja de ε = 2% com confiança de 1 − α = 95%. Sabe-se da
Equação (91) da página 78 que r
p(1 − p)
ε=z (88)
n
Isolando n temos
z 2 p(1 − p)
n= (89)
ε2
Sabe-se que z = Φ(0.975) = 1.96 ≈ 2, e que p(1 − p) atinge seu máximo quando p = 12 . Assim,
1
22 × 2 × (1 − 12 ) 1
n≈ = 2 (90)
ε2 ε
Logo, para uma margem de erro de ε = 2%,
1
n≈ = 2500
0.022

> qnorm(0.975)

[1] 1.959964

> n <- function(e) {1/e^2} # Equaç~


ao (90)
> n(0.02)

[1] 2500

4.2 Amostragem
Amostragem é o processo de obtenção de uma amostra. Inicia com o plano amostral, uma avaliação que
leva em conta as medidas a serem avaliadas e os recursos disponı́veis. Da mesma forma que os laboratórios
retiram amostras de sangue para exames de saúde, cozinheiros experimentam parte da comida para provar
os temperos, fábricas realizam testes destrutivos em parte da sua produção para avaliar a qualidade do
que está sendo produzido e pessoas se informam sobre temas relevantes (ou relvantes) em suas vidas.
Os métodos de seleção podem ser classificados conforme a Tabela 4.2. Procedimentos probabilı́sticos
são em geral mais bem aceitos academicamente, ainda que na prática nem sempre possam ser execu-
tados. Quando isso ocorre, optam-se por processos não probabilı́sticos. Existem diversos métodos de
amostragem, sendo os principais brevemente descritos nas Seções 4.2.2 a 4.2.6.

Page 72
DRAFT VERSION
Procedimento de Seleção
Critério
probabilı́stico não probabilı́stico
objetivo amostras probabilı́sticas amostras criteriosas
subjetivo amostras quase-aleatórias amostras intencionais

Tabela 4.2: Procedimentos amostrais segundo Bolfarine et al. (2005)

4.2.1 Conceitos
A seguir estão apresentados conceitos fundamentais da amostragem, seguindo a estrutura de Bolfarine
et al. (2005)70 .

Unidade Elementar

A unidade elementar, unidade populacional ou simplesmente elemento é a entidade portadora das


informações que pretende-se coletar. Pode ser um objeto, animal ou pessoa. Em certos casos existe mais
de uma maneira de definir a unidade elementar, onde se faz necessário o entendimento dos especialistas
envolvidos. A unidade elementar é uma das definições mais importantes do campo cientı́fico, pois é base
de toda a construção das hipóteses de pesquisa.
Exemplo 4.6. (Pesquisa eleitoral I) Em uma pesquisa eleitoral, classifica-se o eleitor como unidade
elementar. Essa foi fácil.
,
Exemplo 4.7. (Quiz I) Em uma pesquisa com lı́quidos, o que pode ser a unidade elementar?
O
71
Exemplo 4.8. (Quiz II) Defina ‘Indústria do dano moral’ e identifique as unidades elementares
envolvidas na definição proposta.
O

Unidade Amostral

A unidade amostral é uma composição de uma ou mais unidades elementares. É também uma
definição bastante importante, pois é preciso diferenciá-la da unidade elementar para proceder com a
definição e teste das hipóteses de pesquisa.
Exemplo 4.9. (Pesquisa eleitoral II) Em uma pesquisa eleitoral na rua, o eleitor é também unidade
amostral. Caso as entrevistas sejam feitas de casa em casa, o domicı́lio passa a ser unidade amostral,
i.e., um conjunto de unidades elementares (eleitores).
,

Universo U

Universo ou população é o conjunto que reúne toda a informação disponı́vel sobre θ. Usualmente
possui tamanho N elevado, até mesmo infinito, mas em alguns casos pode ser relativamente pequeno.
Faz parte das definições fundamentais do Método Cientı́fico, pois formaliza o escopo das hipóteses de
pesquisa, a captura de informações e as conclusões sobre θ. É denotado por

U = {x1 , x2 , . . . , xN }.

Exemplo 4.10. (Pesquisa eleitoral III) Em uma pesquisa eleitoral na capital gaúcha, o universo de
eleitores do municı́pio de Porto Alegre possui 1,098,515 eleitores72 , i.e., N = 1098515. Formalmente

U = {x1 , x2 , . . . , x1098515 }.

,
70 Prêmio Jabuti 2006.
71 Püschel(2010) e Meyerhof Salama (2011).
72 Fonte: [Link]

Page 73
DRAFT VERSION
Universo de interesse U ∗

Universo de interesse, população objetivo ou população-alvo é a parte do universo composta pelas


unidades elementares de interesse, estabelecido a priori. É uma questão de ordem prática, em que o
universo é tão disperso que torna-se interessante pensar em um universo mais restrito (bairro, clube de
futebol, alunos do Direito) que tenha intersecção com o universo de interesse. É denotado por

U ∗ = {x1 , x2 , . . . , xN ∗ }.

Uma empreiteira pode estar interessada em fazer um levantamento a respeito do direcionamento


desejado pelos seus clientes (universo de interesse), mas estes são apenas alguns dos habitantes da cidade
(universo) onde a empreiteira deseja investir. Neste caso o universo é formado por todos os moradores
do municı́pio, enquanto o universo de interesse se restringe aos clientes em potencial no investimento da
categoria.

Exemplo 4.11. (Pesquisa eleitoral IV) Se a Universidade Livre Feminista estiver interessada apenas em
avaliar os votos das mulheres, pode-se dizer que o universo de interesse será composto pelas N ∗ = 580285
eleitoras na capital gaúcha, denotada por

U ∗ = {x1 , x2 , . . . , x580285 }.

,
Exemplo 4.12. (Quiz III) Você é responsável por apontar os preços ótimos para a venda de apartamentos
em um projeto realizado na cidade que você nasceu. Indique o universo e o universo de interesse nos
seguintes casos: (i) um condomı́nio de luxo e (ii) um conjunto de casa populares.
O

Sistema de referências

Em relação às informações de um estudo, deve-se fazer inicialmente uma avaliação das bases de dados
já disponı́veis para então proceder com a avaliação da viabilidade de um levantamento de dados mais
especı́fico. Este levantamento envolve se montar um plano amostral, contratar, treinar e manter pessoas
para a coleta, criar os protocolos de resposta bem como gerar e analisar os bancos de dados. Caso decida-
se realizar tal levantamento, serão necessárias listas relacionando as unidades populacionais e amostrais.
Na falta de tais listas, utilizam-se sistemas de referências, que são fontes que descrevem o universo a ser
investigado. Podem ser informações razoavelmente atualizadas, como mapas, censos ou listas reunidas.

4.2.2 Amostragem Aleatória Simples (AAS)


Amostragem Aleatória Simples (AAS) é o método mais básico de seleção de amostras, sendo referência
para todos os demais planos amostrais. A partir de uma lista completa da população seleciona-se cada
unidade amostral com igual probabilidade, de tal forma que a cada sorteio os elementos tenham a mesma
chance de serem escolhidos.
Caso a unidade sorteada seja retirada da população e seja realizado um novo sorteio, é dito que
procedeu-se com uma AAS restrita ou sem reposição, indicado por AASs.
Exemplo 4.13. (AASs) De uma urna com x bolas brancas e y bolas pretas sorteia-se uma ao acaso,
com probabilidade 1/(x + y). A bolinha sorteada é retirada da urna e realiza-se um novo sorteio, agora
com probabilidade 1/(x + y − 1). Este é um processo de AAS sem reposição. Faça a árvore de decisão
para três etapas de sorteio com x = 5 e y = 4.

,
Exemplo 4.14. (Mega-Sena da Caixa Econômica Federal) No R pode-se sortear uma amostra sem
reposição para tentar a sorte no jogo da Caixa Econômica Federal.

Page 74
DRAFT VERSION
> sort(sample(1:60, size = 6, replace = F)) # Apostando na Mega-Sena da CEF

[1] 6 21 23 32 41 50

> [Link](1); sort(sample(1:60, size = 6, replace = F)) # Semente pseudo-aleatória fixa

[1] 12 16 22 34 50 52

,
Caso a unidade sorteada tenha a chance de participar novamente da amostra, o procedimento é cha-
mado AAS irrestrita ou com reposição, indicado por AASc. Note que sortear n bolinhas simultaneamente
equivale a fazer n retiradas com reposição.
Exemplo 4.15. (AASc) De uma urna com x bolas brancas e y bolas pretas sorteia-se uma ao acaso,
com probabilidade 1/(x + y). A bolinha sorteada é recolocada na urna e realiza-se um novo sorteio,
novamente com probabilidade 1/(x + y). Este é um processo de AAS com reposição. Se forem necessárias
três bolinhas, é equivalente realizar este procedimento três vezes ou retirar n = 3 bolinhas de uma só vez.
Faça x = 5 e y = 4. ,
Exemplo 4.16. (Urna sem reposição) É esquisito repor a bolinha observada, mas facilita uma barbari-
dade para calcular as probabilidades de sorteio das bolinhas X e Y .

> x <- 5; y <-4


> rbinom(1,1,x/(x+y)) # Pr(X=1) = 5/9, Pr(X=0) = 4/9. Pr(Y=y)?

[1] 0

4.2.3 Amostragem Estratificada (AE)


Um estrato é um subconjunto da população onde controlam-se caracterı́sticas relevantes no estudo, como
sexo, idade e escolaridade. Possui similaridade intra grupo e distinção entre grupos. Este procedimento
torna os estratos homogêneos em relação às caracterı́sticas controladas. Na amostragem estratificada a
população é dividida em k estratos e aplica-se a AAS para selecionar uma amostra de tamanho ni , i ∈
{1, 2, . . . , k} de cada estrato.
Exemplo 4.17. (Amostragem estratificada) Suponha que uma grife esteja interessada em abrir uma
filial dentro da PUCRS. É interessante para os investidores avaliarem “o vestuário dos frequentadores
da PUCRS”. Assim, os prédios poderiam ser considerados estratos em relação aos estilos de vestimenta
utilizados na universidade.
,

4.2.4 Amostragem por Conglomerados (AC)


Conglomerados são subconjuntos da população, distintos entre si em relação às caracterı́sticas de in-
teresse. Em oposição aos estratos, possuem similaridade entre grupos e grande heterogeneidade intra
grupos. Podem ser residências, famı́lias, quarteirões, bairros ou clubinhos de futebol. Tal procedimento
amostral é adequado quando é factı́vel dividir a população em pequenas subpopulações homogêneas,
deniominadas conglomerados. Primeiramente definem-se k conglomerados, dos quais alguns são selecio-
nados segundo uma AAS. Todos os elementos dos conglomerados selecionados são observados. Em geral,
é um plano amostral menos eficiente73 que a AAS ou AE, porém mais econômico.
Exemplo 4.18. (Amostragem por conglomerados) Suponha que uma grife continue interessada em abrir
uma filial dentro da PUCRS. Para avaliar ‘o vestuário dos frequentadores da PUCRS’ foram sorteados,
dentre 17 conglomerados pré-definidos, os grupos ‘restaurante B’, ‘restaurante G’ e ‘ponto de ônibus’,
todos avalidos de segunda a sexta entre 11:30 e 12:30. Todas as pessoas dos grupos sorteados são entre-
vistadas.
,
73 Eficiência é uma medida relativa à variância dos estimadores. Para maiores detalhes, vide Bolfarine et al. (2005).

Page 75
DRAFT VERSION
4.2.5 Amostragem Sistemática (AS)
A sistematização da observação de amostras teve seu inı́cio na indústria. Ao invés de fazer um plano amos-
tral complexo, pode-se simplesmente coletar as informações com um método sistemático pré-determinado.
Tal método é facilitado pelo próprio processo industrial, baseado em uma sequências de peças dispos-
tas em esteiras. Dependendo da acuracidade desejada, escolhe-se a frequência de observações a serem
avaliadas. Baixas frequências de observação reduzem os tamanhos amostrais, enquanto altas frequências
levam a um maior volume de dados. Após definida a frequência “observar uma unidade amostral a cada
k”, basta sortear um número inteiro entre 1 e k para dar inı́cio ao sorteio. Para listar o número das peças
a serem observadas é interessante calcular os termos de uma Progressão Aritmética.
Exemplo 4.19. (Amostragem sistemática) Uma indústria deseja avaliar a adequação de certo com-
ponente à especificação. Para isso decide realizar um procedimento sistemático na esteira das peças
candidatas a serem aferidas. A frequência escolhida é de observar uma a cada k = 15 peças, até ser
atingido um tamanho de amostra de n = 40. Foi então sorteado um número entre 1 e 15, resultando em
9. Assim, a primeira peça a ser avaliada é a de número 9, seguindo a sequência

(9, 9 + 15, 9 + 2 × 15, . . . , 9 + 11 × 15) = (9, 24, 39, . . . , 174).

4.2.6 Amostragem por Cotas (ACot)


Amostragem por cotas é um tipo de amostragem não probabilı́stica largamente utilizada na prática devido
à sua simplicidade de planejamento e execução. O procedimento básico é manter na amostra a mesma
proporção de pessoas com caracterı́sticas controláveis da população.
Exemplo 4.20. (Pesquisa eleitoral V) Em uma pesquisa eleitoral para a prefeitura de Porto Alegre
decide-se entrevistar 1000 pessoas. É conhecida a seguinte distribuição de homens e mulheres nas res-
pectivas faixas etárias da tabela abaixo.

Sexo 16 ` 18 18 ` 25 25 ` 40 40 ` 60 60 ou mais
M
F

Como exercı́cio, vá ao site do IBGE e preencha a tabela acima.


,

4.3 Estimação Pontual


Estimação é o processo de inferir74 a respeito de estados ou quantidades universais desconhecidos com
base no conhecimento sobre o universo e observações amostrais. A abordagem Clássica possui três tipos
de estimação: Pontual (ou por ponto), Intervalo de Confiança (IC) e Teste de Hipóteses (TH).
A estimação pontual utiliza uma estatı́stica como estimativa pontual de um certo parâmetro, i.e., se
apropria de um único valor amostral (ponto) para estimar θ. A sı́mbologia genérica θ̂ – teta chapéu –
indica que parâmetro θ está sendo estimado. Na Tabela 4.1, estão apresentadas as principais estimativas
e parâmetros utilizados ao longo do texto.
Exemplo 4.21. O total estimado (θ̂ ≡ τ̂ ) do valor desviado da Petrobrás até o fechamento desta edição
está em R$ 80 bilhões,
τ̂ = 80, 000, 000, 000 = 8 × 101 0.
/

4.3.1 Proporção ou Percentual


Proporção ou percentual é a frequênca relativa da caracterı́stica de interesse. A estimativa pontual da
proporção universal π é a própria proporção amostral, dada por
# casos com a caracterı́stica de interesse
p = π̂ = .
# casos total
74 Estimar, opinar, palpitar, tentar adivinhar.

Page 76
DRAFT VERSION
Exemplo 4.22. (Estimativa pontual da proporção) Suponha que deseja-se calcular a estimativa pontual
para a ‘proporção de fumantes da PUCRS’, denotada por π. Em uma amostra de n = 117 frequentadores
da universidade, observaram-se 25 fumantes. A estimativa pontual de π é dada por
25
p = π̂ = ≈ 0.2137 = 21.37%.
117
,

4.3.2 Média
A estimativa pontual da média populacional µ é a própria média amostral, dada por
Pn
xi
x̄ = x̄n = µ̂ = i=1 .
n
Exemplo 4.23. (Estimativa pontual da média) Suponha que haja interesse em estudar a média de altura
da população de Porto Alegre, desconhecida e denotada pelo parâmetro µ. Um levantamento com 1.4
milhão de porto-alegrenses é impraticável, mas é possı́vel observar uma amostra da altura de 60 alunos
de certa disciplina da PUCRS. A altura média da turma foi x̄60 = 1.67. Pode-se dizer que uma possı́vel
estimativa pontual da altura média das pessoas de Porto Alegre é µ̂ = 1.67.
,

4.3.3 Variância e Desvio Padrão


A estimativa pontual da variância populacional σ 2 é dada por
Pn  Pn
(xi − x̄)2 2
 
i=1 xi n
s2 = σ̂ 2 = i=1 = − x̄2 .
n−1 n n−1

A estimativa por ponto do desvio padrão é calculada por



s = σ̂ = s2 .

Exemplo 4.24. (Estimativa pontual da variância e do desvio padrão) Suponha novamente as informa-
ções do Exemplo 4.23. A estimativa pontual da variância√amostral é s2 = σ̂ 2 = 0.0105. Para calcular a
estimativa pontual do desvio padrão, basta fazer s = σ̂ = 0.0105 ≈ 0.1025
,

4.4 (Estimação por) Intervalo de Confiança


Suponha que seu amigo estime que ficará pronto para ir ao sushi às 19 horas, 37 minutos e 22 segundos.
É difı́cil de acreditar na estimativa do amigo devido à sua extrema precisão. Isso ocorre com qualquer
estimativa pontual, portanto uma sugestão para aumentar a confiança é fornecer um intervalo de horário,
no estilo “estarei pronto entre 19h e 20h”. Neste contexto é introduzida a noção de intervalo de confiança
(IC), um método formal para construir intervalos com confiança pré-estabelecida para os parâmetros de
interesse. No exemplo do sushi, o parâmetro desconhecido θ é o horário em que o amigo ficará pronto.

Intervalos e Limites de Confiança

Os intervalos de confiança possuem a estrutura básica

IC [Parâmetro, Confiança] = Estimativa Pontual∓Margem de Erro = [Limite Inferior, Limite Superior] .

Os limites superiores de confiança possuem a estrutura básica

IC [Parâmetro, Confiança] = Estimativa Pontual + Margem de Erro = ]−∞, Limite Superior] .

Os limites inferiores de confiança possuem a estrutura básica

IC [Parâmetro, Confiança] = Estimativa Pontual − Margem de Erro = [Limite Inferior, +∞[ .

Page 77
DRAFT VERSION
Parâmetro: parâmetro de interesse para o qual deseja-se calcular o IC, denotado genericamente por θ;
Confiança: confiança desejada no IC, denotada por 1 − α;
Estimativa pontual : estimativa por ponto do parâmetro de interesse;
Margem de erro: medida de variabilidade que depende da confiança desejada;
Limite inferior : valor que limita o IC à esquerda;
Limite superior : valor que limita o IC à direita.

4.4.1 Proporção
O IC para a proporção populacional π é dado pela expressão
r " r r #
p(1 − p) p(1 − p) p(1 − p)
IC [π, 1 − α] = p ∓ z = p−z ,p + z (91)
n n n

onde 1 − α é a confiança do intervalo, p é a proporção amostral, n é o tamanho da amostra e z = z α2 é


o quantil da distribuição normal padrão que acumula α2 de probabilidade.
Exemplo 4.25. (IC para π) Suponha novamente o Exemplo 4.22, onde deseja-se calcular o IC para a
proporção de fumantes da PUCRS. Sabe-se que π̂ = p = 25/117 ≈ 0.2137, n = 117 e z = 1.96. O IC de
1 − α = 95% é
s
25 25

25 117 1 − 117
IC [π, 95%] = ∓ 1.96 ≈ 0.2137 ∓ 0.0743 = [0.1397, 0.2883] = [13.97%, 28.83%] .
117 117

A margem de erro é de aproximadamente 0.0743 = 7.43%, Note a diferença de precisão entre a tabela,
consultando a probabilidade 0.0250 correspondente a z = −1.96, e o valor calculado com a função qnorm.

> n <- 117


> p <- 25/n
> z <- abs(qnorm(0.025)) # |-1.959964|
> (e <- z*sqrt(p*(1-p)/n)) # Margem de erro

[1] 0.07427338

> (LIpi <- p - e) # Limite Inferior

[1] 0.1394018

> (LSpi <- p + e) # Limite Superior

[1] 0.2879486

4.4.2 Média com σ conhecido


Um leitor atento pode estar se questionando a respeito do σ conhecido, visto que para calcular o desvio
padrão universal σ necessita-se da média universal µ, também desconhecida. Porém, como forma de
construção da teoria, é didaticamente apropriado apresentar primeiramente o cálculo do IC para a média
universal µ supondo o desvio padrão σ conhecido. Outros motivos para abordar este tópico desta maneira
são que i) desvios padrão são geralmente estáveis, e pode-se ter calculado estimativas de σ em estudos
similares e ii) o tamanho da amostra é tão grande que é praticamente equivalente calcular o IC com σ
conhecido ou desconhecido75 .
O IC para a média universal com σ conhecido é dado pela expressão
 
σ σ σ
IC [µ, 1 − α] = x̄ ∓ z √ = x̄ − z √ , x̄ + z √ , (92)
n n n
75 Seção 4.4.3.

Page 78
DRAFT VERSION
onde 1 − α é a confiança do intervalo, x̄ é a média amostral, σ é o desvio padrão universal magicamente
conhecido, n é o tamanho da amostra e z = z α2 é o quantil da distribuição normal padrão que acumula
α
2 de probabilidade.

Exemplo 4.26. (IC para µ com σ conhecido) Utilizando as 10 primeiras observações da Tabela 2.5
(pg. 19), suponha que X: ‘altura de mulheres atendidas em um certo hospital público de Porto Alegre
durante o inverno 2012’ tenha distribuição normal com média µ desconhecida e desvio padrão universal
conhecido σ = 0.05, denotado por X ∼ N (µ, 0.052 ). A média da amostra é x̄10 = 1.63 e z = 1.96. O IC
de 1 − α = 95% é
0.05
IC [µ, 95%] = 1.63 ∓ 1.96 √ ≈ 1.63 ∓ 0.03 ≈ [1.60, 1.66] .
10
A margem de erro é de aproximadamente 0.03.

> n <- 10
> m <- 1.63
> sigma <- 0.05 # 'sigma' universal
> z <- abs(qnorm(0.025)) # |-1.959964|
> (e <- z*s/sqrt(n)) # Margem de erro

[1] 0.02805723

> (LImusig <- m - e) # Limite Inferior

[1] 1.601943

> (LSmusig <- m + e) # Limite Superior

[1] 1.658057

4.4.3 Média com σ desconhecido


Este é o caso mais realista, no qual estima-se o desvio padrão universal σ através do desvio padrão
amostral s. O IC para a média universal com σ desconhecido é dado pela expressão
 
s s s
IC [µ, 1 − α] = x̄ ∓ t √ = x̄ − t √ , x̄ + t √ , (93)
n n n

onde 1 − α é a confiança do intervalo, x̄ é a média amostral, s é o desvio padrão amostral, n é o tamanho


da amostra e t = tn−1, α2 é o quantil da distribuição t com n − 1 graus de liberdade que acumula 1 − α2
de probabilidade. Note a troca de σ por s, implicando na penalidade de utilizar t no lugar de z.

Exemplo 4.27. (IC para µ com σ desconhecido) Novamente utilizando as 10 primeiras observações
da Tabela 2.5, suponha agora que X: ‘altura de mulheres atendidas em um certo hospital público de
Porto Alegre durante o inverno 2012’ tenha distribuição normal com média µ e desvio padrão universal
σ desconhecidos, denotado por X ∼ N (µ, σ). A média e o desvio padrão amostrais são, respectivamente
x̄10 = 1.63 e s = 0.05. t = t10−1, 5% = t9,2.5% = 2.262 O IC de 1 − α = 95% é
2

0.05
IC [µ, 95%] = 1.63 ∓ 2.262 √ = 1.63 ∓ 0.04 ≈ [1.59, 1.67] .
10
A margem de erro é de aproximadamente 0.04, maior que a margem de erro 0.03 quando assume-se σ
conhecido.

Page 79
DRAFT VERSION
> n <- 10
> m <- 1.63
> s <- 0.05 # 's' amostral
> t <- abs(qt(0.025, n-1)) # |-2.2621572|
> (e <- t*s/sqrt(n)) # Margem de erro

[1] 0.03576785

> (LImus <- m - e) # Limite Inferior

[1] 1.594232

> (LSmus <- m + e) # Limite Superior

[1] 1.665768

4.4.4 Variância
O IC para a variância universal σ 2 é dado por
" #
 2  (n − 1)s2 (n − 1)s2
IC σ , 1 − α = ,
χ2α χ21− α
2 2

onde 1 − α é a confiança do intervalo, s é a variância amostral, n é o tamanho da amostra, χ2α é o


2
2
quantil da distribuição χ2 com ν = n − 1 graus de liberdade que acumula α2 de probabilidade e χ21− α é
2
o quantil da distribuição χ2 com ν = n − 1 graus de liberdade que acumula 1 − α2 de probabilidade.
Exemplo 4.28. (IC para σ 2 ) Novamente utilizando as 10 primeiras observações da Tabela 2.5, sabe-
se que a variância amostral é s2 = 0.052 = 0.0025 e ν = 10 − 1 = 9. Pela Tabela da página 122,
χ20.025 = 19.02 e χ20.975 = 2.70. O IC de 1 − α = 95% para σ 2 é
 
 2  (10 − 1) × 0.0025 (10 − 1) × 0.0025
IC σ , 95% = , ≈ [0.0012, 0.0083] .
19.02 2.70

> n <- 10
> s <- 0.05 # 's' amostral
> chi025 <- qchisq(0.975, n-1) # 19.022768
> chi975 <- qchisq(0.025, n-1) # 2.7003895
> (LIsig2 <- (n-1)*s^2/chi025) # Limite Inferior

[1] 0.001182793

> (LIsig2 <- (n-1)*s^2/chi975) # Limite Superior

[1] 0.008332131

4.4.5 Desvio Padrão


Análogo ao IC para a variância universal, o IC para o desvio padrão universal σ é dado por
"s s #
(n − 1)s2 (n − 1)s2
IC [σ, 1 − α] = ,
χ2α χ21− α
2 2

onde 1 − α é a confiança do intervalo, s é a variância amostral, n é o tamanho da amostra, χ2α é o


2
2
quantil da distribuição χ2 com ν = n − 1 graus de liberdade que acumula α2 de probabilidade e χ21− α é
2
o quantil da distribuição χ2 com ν = n − 1 graus de liberdade que acumula 1 − α2 de probabilidade.

Page 80
DRAFT VERSION
Exemplo 4.29. (IC para σ) Novamente utilizando as 10 primeiras observações da Tabela 2.5, sabe-
se que a variância amostral é s2 = 0.052 = 0.0025 e ν = 10 − 1 = 9. Pela Tabela da página 122,
χ20.025 = 19.02 e χ20.975 = 2.70. O IC de 1 − α = 95% para σ é
"r r #
(10 − 1) × 0.0025 (10 − 1) × 0.0025 h√ √ i
IC [σ, 95%] = , = 0.0012, 0.0083 ≈ [0.0344, 0.0913] .
19.02 2.70

> n <- 10
> s <- 0.05 # 's' amostral
> chi025 <- qchisq(0.975, n-1) # 19.022768
> chi975 <- qchisq(0.025, n-1) # 2.7003895
> (LIsig <- sqrt((n-1)*s^2/chi025)) # Limite Inferior

[1] 0.03439176

> (LIsig <- sqrt((n-1)*s^2/chi975)) # Limite Superior

[1] 0.09128051

4.5 (Estimação por) Teste de Hipóteses


Os testes de hipóteses são procedimentos utilizados para atribuir um grau de credibilidade às hipóteses em
estudos cientı́ficos. Pelo paradigma clássico, a medida padrão de credibilidade é conhecida popularmente
por p-value ou valor-p. Os teste de hipóteses possuem as mesmas caracterı́sticas e propriedades dos res-
pectivos intervalos de confiança. Desta forma, apresenta-se um breve exemplo abordando a equivalência
entre os TH e os IC para a proporção universal π.

4.5.1 Equivalência entre Testes de Hipóteses e Intervalos de Confiança


Exemplo 4.30. (TH=IC) Suponha uma moeda com probabilidade de face cara P r(H) = π. Em princı́pio
não sabemos o valor de π, e pode ser interessante considerar duas configurações:
• π = 0.5, i.e., a moeda é equilibrada (não viesada/não viciada/honesta)

• π 6= 0.5, i.e., ela é desequilibrada (viesada/viciada/desonesta)


As hipóteses podem ser escritas na forma

H0 : π = 0.5
H1 : π 6= 0.5
Sob H0 , i.e., supondo H0 verdadeira,
r
0.5 (1 − 0.5) 0.98
IC [π, 95%] = 0.5 ∓ 1.96 = 0.5 ∓ √ .
n n

Assim, ao realizar n = 100 lançamentos e observar uma frequência de caras no intervalo


0.98
IC [π, 95%] = 0.5 ∓ √ = [0.402, 0.598] ,
100
pode-se considerar a moeda equilibrada com 95% de confiança. Caso a frequência seja inferior a 40.2%
ou superior a 59.8%, há indı́cios de que a moeda é desequilibrada, também com 95% de confiança. Pela
terminologia dos testes de hipóteses, não se rejeita H0 com α = 5%. Se n = 25,
0.98
IC [π, 95%] = 0.5 ∓ √ = [0.304, 0.696] ,
25

Page 81
DRAFT VERSION
obtém-se um intervalo maior, i.e., menos preciso para a mesma confiança de 95%. Como exercı́cio, use
a função ic para definir outros valores para n e teste em uma moeda.

> ic <- function(n){


cat('[', 0.5-.98/sqrt(n), ',', 0.5+.98/sqrt(n), ']')
}
> ic(100)

[ 0.402 , 0.598 ]

> ic(25)

[ 0.304 , 0.696 ]

Exemplo 4.31. (Esta moeda é equilibrada?) Você pega uma moeda qualquer e decide testar se ela é
equilibrada ou não. Pode-se definir que ela é equilibrada se a proporção de n lançamentos ficar próxima
de 50%. Como você definiria “próxima”?
,

4.5.2 Hipóteses
Os testes de hipóteses são dicotômicos, i.e., estrutura-se o problema em duas hipóteses concorrentes. Isso
significa que o aplicador tem o papel de dividir o problema em dois conjuntos disjuntos que englobem
todas as possibilidades de ação. As hipóteses são chamadas de hipótese nula (H0 ) e hipótese alternativa
(H1 ou Ha ). De maneira genérica são escritas na forma

H0 :
H1 :
Hipóteses descritas de maneira literal são conhecidas como hipóteses de pesquisa, enquanto as descritas
em formato matemático são chamadas hipóteses estatı́sticas. Elas devem ser equivalentes, mas sua
denominação pode ser adequada conforme o momento da pesquisa. Ao definir os objetivos e apresentar
os resultados é mais apropriado fazer uso de termos literais. Porém, durante a execução da análise –
passo intermediário entre a definição dos objetivos e a divulgação dos resultados – é mais adequado
utilizar hipóteses estatı́sticas, pela necessidade de detalhamento matemático nesta etapa.
Exemplo 4.32. (Definindo as hipóteses sobre a moeda) Retomando o Exemplo 4.31, podemos definir
respectivamente as hipóteses do pesquisador e estatı́stica como
 
H0 : a moeda é equilibrada H0 : π = 0.5
≡ .
H1 : a moeda não é equilibrada H1 : π 6= 0.5
,

Hipótese Nula H0

A hipótese nula é a hipótese a ser testada, definda pelo parâmetro genérico θ0 . A expressão nula faz
referência aos planejamentos de experimentos, quando não há diferença entre os tratamentos. Se isso
ocorre, os parâmetros populacionais são considerados iguais, i.e., o efeito dos tratamentos seria nulo ou
sem diferença significativa. Por este motivo H0 é geralmente associada ao não-efeito, i.e., a contraposição
da teoria testada. Utiliza-se a expressão “sob H0 ” para indicar a utilização do valor θ0 na realização dos
cálculos. A hipótese de igualdade H0 : θ = θ0 é conhecida por hipótese precisa, ou sharp hypothesis.

Page 82
DRAFT VERSION
1ª Lei Universal dos Testes de Hipóteses

A igualdade sempre está em H0 .

  
H0 : θ = θ 0 H0 : θ ≥ θ0 H0 : θ ≤ θ0
ou ou
H1 : θ 6= θ0 H1 : θ < θ0 H1 : θ > θ0

Hipótese Alternativa H1
A hipótese alternativa é a hipótese concorrente da hipótese nula. Por não conter a igualdade é geralmente
associada à diferença entre tratamentos, sendo comumente relacionada à teoria que deseja-se testar. Por
este motivo é conhecida também como hipótese de pesquisa. Ela pode ser bilateral (H1 : θ 6= θ0 ),
unilateral inferior (H1 : θ < θ0 ) ou superior (H1 : θ > θ0 ). Na Figura 4.2 estão apresentadas as regiões
de rejeição e de aceitação para hipóteses uni e bilaterais. Sua escolha deve considerar a estrutura do
problema, podendo haver mais de um modo de apresentar as hipóteses.

H1 H0 H1

(a) Hipótese bilateral (H1 : θ 6= θ0 )

H1 H0 H0 H1

(b) Hipótese unilateral inferior (H1 : θ < θ0 ) (c) Hipótese unilateral superior (H1 : θ > θ0 )

Figura 4.2: Tipos de hipóteses alternativas e suas regiões de rejeição

Exemplo 4.33. (Hipótese bilateral) A hipótese alternativa H1 : π 6= 0.5 é dita bilateral, conforme Figura
4.2a. É o complementar da hipótese precisa H0 : π = 0.5.
,

4.5.3 Estatı́stica do Teste - Univariada


Para medir a distância probabilı́stica entre os valores observados na amostra e o valor teórico θ0 , utiliza-
se a estatı́stica do teste. Ela é calculada a partir das informações da amostra e do próprio θ0 , sendo que
cada parâmetro testado possui sua respectiva estatı́stica de teste. Quando devidamente calculado, este
valor é associado a uma distribuição de probabilidades conhecida.
Proporção
Sob H0 : π = π0 ,
!
p − π0 √ p − π0
zteste = p = n p ∼ N (0, 1). (94)
π0 (1 − π0 )/n π0 (1 − π0 )

Page 83
DRAFT VERSION
Exemplo 4.34. (Lançando a moeda) Suponha n = 100 lançamentos e 40 caras observadas. Pode-se
40
medir a distância do teórico H0 : π = 0.5 para o observado p = 100 = 0.4 através da estatı́stica do teste
!
√ 0.4 − 0.5
zteste = 100 p = −2,
0.5(1 − 0.5)

ou seja, estima-se que 0.4 está dois desvios-padrão abaixo de 0.5. Avalie este resultado observando a
Figura 3.3 da página 59. Compare com o Exemplo 4.30. O que você conclui?

> theta <- 0.5


> x <- 40
> n <- 100
> p <- x/n
> (zt <- sqrt(n)*(p-theta)/sqrt(theta*(1-theta)))

[1] -2

Média com σ conhecido

Sob H0 : µ = µ0 ,

 
x̄ − µ0 x̄ − µ0
zteste = √ = n ∼ N (0, 1). (95)
σ/ n σ

Exemplo 4.35. (σ) Suponha σ = 0.3185. Se quisermos comparar a média teórica H0 : µ = 2.027 com
uma média obtida a partir de n = 5 observações x̄5 = 2.115, pode-se utilizar a estatı́stica do teste

 
2.115 − 2.027
zteste = 5 ≈ 0.618.
0.3185

Avalie este resultado observando a Figura 3.3 da página 59. O que você conclui?

> sigma <- 0.3185


> theta <- 2.027
> n <- 5
> x_bar <- 2.115
> (zt <- sqrt(n)*(x_bar-theta)/(sigma))

[1] 0.6178147

Média com σ desconhecido

Sob H0 : µ = µ0 ,

 
x̄ − µ0 x̄ − µ0
tteste = √ = n ∼ tn−1 . (96)
s/ n s

Exemplo 4.36. (s) Suponha s = 0.3185. Se quisermos comparar a média teórica H0 : µ = 2.027 com
uma média obtida a partir de n = 5 observações x̄5 = 2.115, pode-se utilizar a estatı́stica do teste

 
2.115 − 2.027
tteste = 5 ≈ 0.618.
0.3185

Avalie este resultado observando a linha de 5 − 1 = 4 graus de liberdade na tabela da distribuição t na


página 121 ou pelo nomograma da Figura 3.7b na página 64. O que você conclui?

Page 84
DRAFT VERSION
> s <- 0.3185
> theta <- 2.027
> n <- 5
> x_bar <- 2.115
> (tt <- sqrt(n)*(x_bar-theta)/s)

[1] 0.6178147

Variância

Sob H0 : σ 2 = σ02 ,

(n − 1)s2
χ2teste = ∼ χ2n−1 . (97)
σ02

Exemplo 4.37. (Avaliando σ) Suponha um desvio padrão s = 0.32, obtido de uma amostra de tamanho
n = 16. Pode-se comparar este valor observado com o teórico H0 : σ = 0.25 através da estatı́stica

(16 − 1) × 0.322
χ2teste = = 24.576.
0.252
Compare com a linha ν = 16 − 1 = 15 da tabela de qui-quadrado da página 122. O que você conclui?

> s <- 0.32


> theta <- 0.25
> n <- 16
> (ct <- (n-1)*s^2/theta^2 )

[1] 24.576

4.5.4 Valor-p (p-value)


Note que nos Exemplos 4.34 a 4.37 mediu-se a distância (padronizada) entre valores amostrais e os
valores teóricos. Para mensurar se estas distâncias sugerem um descolamento da hipótese nula H0 , pode-
se utilizar uma medida que indique a evidência em favor de H0 . Esta medida é obtida comparando-se a
estatı́stica de teste com a distribuição teórica apropriada.
Pela abordagem clássica, a medida usual é o valor-p, popularmente conhecido por p-value. Ele indica
a probabilidade de se obter um valor mais extremo do que a estatı́stica de teste (distância padronizada)
obtida. Formalmente é a probabilidade do erro do tipo I76 , conforme Tabela 4.3. Este é o valor da
probabilidade de errar ao rejeitar H0 , i.e., decidir por H1 quando H0 é verdadeira.

H0
Decisão
Verdadeira Falsa
Rejeita H0 Erro do Tipo I OK
Aceita (Não rejeita) H0 OK Erro do Tipo II

Tabela 4.3: Possibilidades ao decidir por uma hipótese

Exemplo 4.38. (Medindo o equilı́brio da moeda) Suponha novamente o Exemplo 4.38. O valor-p pode
ser obtido por
valor − p = 2 × P r(Z < −2) ≈ 0.0455.
76 Também conhecida por nı́vel descritivo amostral ou simplesmente p. Esta última alternativa, apesar de mais concisa,

foi evitada para não haver conflito com a simbologia utilizada para a proporção amostral, já denotada por p.

Page 85
DRAFT VERSION
Se 0.0455 = 4.55%, ou a probabilidade de errar ao rejeitar H0 , for considerada baixa pelo pesquisador,
ele pode decidir pela rejeição; caso a considere alta, deve decidir pela aceitação (não rejeição) de H0 ,
optando por H1 .

> theta <- 0.5


> x <- 40
> n <- 100
> p <- x/n
> zt <- sqrt(n)*(p-theta)/sqrt(theta*(1-theta))
> (p_value <- 2*pnorm(-abs(zt))) # Multiplica-se por 2 pelo teste ser bilateral

[1] 0.04550026

,
Exemplo 4.39. (Princı́pio da Verossimilhança 2) Suponha que deseja-se testar a hipótese H0 : θ ≤ 1/2
contra H0 : θ > 1/2. São contemplados dois processos experimentais:

• E1 : lançar a moeda n = 12 vezes;

• E2 : lançar a moeda até que apareçam k = 3 ‘caras’

Admita que o resultado observado nas duas experiências foi x = 9 ‘coroas’ (portanto 3 ‘caras’),
que é uma particular realização da variável aleatória X, que designa o número total de ‘coroas’ dos
experimentos E1 e E2 . Para um clássico o nı́vel crı́tico (ou valor-p, a probabilidade de obter X ≥ 9) da
hipótese H0 : θ = 1/2 difere nos dois casos.
No caso E1 , X tem distribuição binomial – X ∼ B (12, θ) – cujo nı́vel crı́tico é

     12    12    12    12


1 12 1 12 1 12 1 12 1
P r X ≥ 9|θ = = + + + = 0.075.
2 9 2 10 2 11 2 12 2

No caso E2 , X tem distribuição binomial negativa – X ∼ BN (3, 1 − θ) – que tem nı́vel crı́tico

     12    13    14


1 11 1 12 1 13 1
P r X ≥ 9|θ = = + + + · · · = 0.0325.
2 9 2 10 2 11 2

Logo, se for adotado um limiar de significância de 5%, H0 é rejeitada no caso E2 e não rejeitada em
E1 . Assumindo o princı́pio da verossimilhança, as conclusões devem ser idênticas nos dois casos. Em
3
ambos a (função de) verossimilhança é proporcional a θ9 (1 − θ) . De fato, as verossimilhanças em E1 e
E2 são
 
12 9 3 3 3
L1 (θ| x = 9) = θ (1 − θ) = 220 θ9 (1 − θ) ∝ θ9 (1 − θ)
9

 
11 9 3 3 3
L2 (θ| x = 9) = θ (1 − θ) = 55 θ9 (1 − θ) ∝ θ9 (1 − θ)
9
,

4.5.5 Valor Crı́tico


O valor crı́tico é o quantil da distribuição que delimita as regiões de rejeição e aceitação. Nas distribuições
normal e t são chamados genericamente zcrı́tico e tcrı́tico .
Exemplo 4.40. (Valor crı́tico) Suponha α = 5% para diferentes testes de hipóteses conforme Figura
4.3. Para a distribuição t assumiu-se gl = 4.
,

Page 86
DRAFT VERSION

N (0, 1) t4
5% 95% 5% 95%

−1.64 −2.13
(a) Normal, H1 : θ < θ0 , α = 5%, zcrı́tico = −1.64 (b) t, gl = 4, H1 : θ < θ0 , α = 5%, tcrı́tico = −2.132

N (0, 1) t4
95% 5% 95% 5%

1.64 2.13
(c) Normal, H1 : θ > θ0 , α = 5%, zcrı́tico = 1.64 (d) t, gl = 4, H1 : θ > θ0 , α = 5%, tcrı́tico = 2.132

N (0, 1) t4
2.5% 95% 2.5% 2.5% 95% 2.5%

−1.96 1.96 −2.78 2.78


(e) Normal, H1 : θ 6= θ0 , α = 5%, |zcrı́tico | = 1.96 (f) t, gl = 4, H1 : θ > θ0 , α = 5%, |tcrı́tico | = 2.776

Figura 4.3: Alguns exemplos de valores crı́ticos

Teste Qui-quadrado (de Pearson) de aderência

H0 : No universo representado por uma amostra, há diferença entre as frequências esperadas e obser-
vadas?

k
X (Oi − Ei )2
χ2 = ∼ χ2k−1 (98)
i=1
Ei

Com a correção de Yates:

k
X (|Oi − Ei | − 0.5)2
χ2Y ates = ∼ χ2k−1 (99)
i=1
Ei

Exemplo 4.41 (Adaptado de Sheskin (2004)). (Teste qui-quadrado de aderência) Um dado é lançado
120 vezes, a fim de determinar se é ou não é equilibrado (viesado). O valor 1 aparece 20 vezes, o valor
2 aparece 14 vezes, o valor 3 aparece 18 vezes, o valor 4 aparece 17 vezes, o valor de 5 aparece 22 vezes,
e o valor 6 aparece 29 vezes. Os valores observados sugerem que o dado é equilibrado?

Face (i) 1 2 3 4 5 6
Oi 20 14 18 17 22 29
Ei 20 20 20 20 20 20

Tabela 4.4: Valores observados e esperados

Page 87
DRAFT VERSION
> o <- c(20,14,18,17,22,29) # Observados
> p <- rep(1/6,6) # Distribuiç~
ao uniforme (dado equilibriado)
> e <- 120*p # Valores esperados se o dado for equilibrado
> k <- length(o) # Número de categorias
> qui <- sum((o-e)^2/e) # Equaç~
ao (60)
> 1-pchisq(qui,k-1) # p-value

[1] 0.2439246

> [Link](o) ao '[Link]'


# Pela funç~

Chi-squared test for given probabilities

data: o
X-squared = 6.7, df = 5, p-value = 0.2439

4.5.6 Estatı́stica do Teste - Bivariada


Em muitos casos práticos é necessária a comparação entre valores obtidos de dois universos distintos.
Para isso existem procedimentos chamados bivariados.
Proporção
Sob H0 : π1 = π2 ,
p1 − p2
zteste = s   ∼ N (0, 1), (100)
1 1
p̄(1 − p̄) +
n1 n2

onde n1 e n2 são os tamanhos das amostras retiradas de dois universos, X1 e X2 representam o


X1 X2 X1 + X2
número de observações pertencentes aos universos 1 e 2, p1 = , p2 = e p̄ = .
n1 n2 n1 + n2
Exemplo 4.42. (Duas moedas) Suponha duas moedas rotuladas 1 e 2. Se observarmos 7 caras em
n1 = 35 lançamentos da moeda 1 e 7 caras em n2 = 100 lançamentos da moeda 2, pode-se obter p1 =
7/35 = 0.2, p2 = 7/100 = 0.07 e p̄ = (7 + 7)/(35 + 100) = 14/135 ≈ 0.1037. Para comparar a proporção
de caras das moedas, representada por H0 : π1 = π2 , pode-se utilizar a estatı́stica
0.2 − 0.07
zteste = s    ≈ 2.17.
14 14 1 1
1− +
135 135 35 100

> x1 <- 7
> n1 <- 35
> x2 <- 7
> n2 <- 100
> p1 <- x1/n1
> p2 <- x2/n2
> ph <- (x1+x2)/(n1+n2)
> (zt <- (p1-p2)/sqrt(ph*(1-ph)*(1/n1+1/n2)))

[1] 2.171139

> (p_value <- 2*pnorm(-abs(zt)))

[1] 0.02992069

Page 88
DRAFT VERSION
Média com σ12 e σ22 conhecidas
Sob H0 : µ1 − µ2 = ∆0 ,
(x̄1 − x̄2 ) − ∆0
zteste = s ∼ N (0, 1), (101)
σ12 σ22
+
n1 n2
onde n1 e n2 são os tamanhos das amostras retiradas de dois universos, x̄1 e x̄2 representam as médias
amostrais das populações 1 e 2, e σ12 e σ22 são as respectivas variâncias populacionais.
Média com σ12 e σ22 desconhecidas
Sob H0 : µ1 − µ2 = ∆0 ,
(x̄1 − x̄2 ) − ∆0
Tteste = s   ∼ tn1 +n2 −2 , (102)
1 1
s2p +
n1 n2

(n1 − 1)s21 + (n2 − 1)s22


s2p = , (103)
n1 + n2 − 2
onde n1 e n2 são os tamanhos das amostras retiradas de dois universos e x̄1 e x̄2 representam as
médias amostrais das populações 1 e 2.
Exemplo 4.43. (Teste t) Faça ?[Link].

> [Link](1:10, y = c(7:20)) # P = .00001855, diferença significativa

Welch Two Sample t-test

data: 1:10 and c(7:20)


t = -5.4349, df = 21.982, p-value = 1.855e-05
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
-11.052802 -4.947198
sample estimates:
mean of x mean of y
5.5 13.5

> [Link](1:10, y = c(7:20, 200)) # P = .1245, sem diferença significativa

Welch Two Sample t-test

data: 1:10 and c(7:20, 200)


t = -1.6329, df = 14.165, p-value = 0.1245
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
-47.242900 6.376233
sample estimates:
mean of x mean of y
5.50000 25.93333

,
Variâncias
Sob H0 : σ12 = σ22 ,
s21 /σ12 s21
Fteste = = ∼ Fn1 −1,n2 −1 , (104)
s22 /σ22 s22
onde n1 e n2 são os tamanhos das amostras retiradas de dois universos e s21 e s22 representam as
variâncias amostrais das populações 1 e 2.

Page 89
DRAFT VERSION
Exemplo 4.44. (Teste de variâncias) Faça ?[Link].

> [Link](2); x <- rnorm(50, mean = 0, sd = 2)


> [Link](3); y <- rnorm(30, mean = 1, sd = 1)
> [Link](x, y) # x e y t^
em a mesma vari^
ancia?

F test to compare two variances

data: x and y
F = 7.7713, num df = 49, denom df = 29, p-value = 1.048e-07
alternative hypothesis: true ratio of variances is not equal to 1
95 percent confidence interval:
3.904505 14.621142
sample estimates:
ratio of variances
7.771348

Teste Qui-quadrado (de Pearson) para tabelas r × c

H0 : No universo representado por uma amostra em uma tabela de contingência, há diferença entre
as frequências esperadas e observadas nas células?

r X c
X (Oij − Eij )2
χ2 = ∼ χ2(r−1)(c−1) (105)
i=1 j=1
Eij

Com a correção de Yates:

r X c
X (|Oij − Eij | − 0.5)2
χ2 = ∼ χ2(r−1)(c−1) (106)
i=1 j=1
Eij

> [Link] <- matrix(c(90,10,70,30), nrow=2, byrow=T) # Tabela 2.8


> [Link]([Link]) # Teste qui-quadrado de Pearson

Pearson's Chi-squared test with Yates' continuity correction

data: [Link]
X-squared = 11.281, df = 1, p-value = 0.0007829

Teste Exato de Fisher para tabelas r × c

Seguindo o padrão da Tabela 2.7, calcula-se a probabilidade exata por

n·1 ! n·2 ! n1· ! n2· !


P = (107)
n! n11 ! n12 ! n21 ! n22 !

Page 90
DRAFT VERSION
> [Link] <- matrix(c(90,10,70,30), nrow=2, byrow=T) # Tabela 2.8
> [Link]([Link]) # Teste exato de Fisher

Fisher's Exact Test for Count Data

data: [Link]
p-value = 0.0006504
alternative hypothesis: true odds ratio is not equal to 1
95 percent confidence interval:
1.684537 9.405984
sample estimates:
odds ratio
3.831525

EXERCÍCIOS EXTRAS
1. (Adaptado de ?) Para cada item abaixo, indique as hipóteses de pesquisa e estatı́sticas que estão sendo testadas
a) A companhia de transporte afirma que, em média, o intervalo entre sucessivos ônibus de uma determinada linha
é de 15 minutos. Uma associação de usuários de transportes coletivos acha que a pontualidade é muito importante,
e deseja testar a afirmação da companhia.
b) Os amortecedores de automóveis que circulam em cidades duram pelo menos 100 mil quilômetros em média,
segundo a informação de algumas oficinas especializadas. O proprietário de uma locadora de veı́culos deseja testar
esta afirmação.
c) Um veterinário afirma ter obtido um ganho médio diário de pelo menos 3 litros de leite por vaca com uma nova
composição de ração. Um pecuarista acredita que o ganho não é tão grande assim.
d) Garrafas de cerveja deveriam conter 600mL. Os órgãos de fiscalização desejam avaliar se uma fábrica deve ou não
ser autuada por engarrafar cervejas com uma quantidade menor que o indicado no rótulo.
e) O dado de um cassino parece estar viciado, saindo o valor 1 com uma frequência muito grande.
f) Um fabricante afirma que a sua vacina previne pelo menos 80% dos casos de uma doença. Um grupo de médicos
desconfia que a vacina não é tão eficiente assim.

2. (Adaptado de ?) Uma variável aleatória tem distribuição Normal com desvio padrão igual a 12. Estamos testando se
a média é igual ou diferente de 20. Para isso coletamos uma amostra de tamanho 100, obtendo uma média amostral
de 17.4.
a) Formule as hipóteses.
b) Obtenha a região crı́tica e dê a conclusão para os seguintes nı́veis de significância: 1%, 5% e 10%.
c) Construa um intervalo com 95% de confiança para a média. Interprete.

3. (Adaptado de Pagano (2004)) A distribuição da pressão sanguı́nea diastólica na população de mulheres diabéticas
segue distribuição Normal com média desconhecida. Os médicos desejam saber se esta média é a mesma da popu-
lação de mulheres sem diabetes, que é 74.4 mmHg.
a) Construa as hipóteses.
b) Uma amostra de 10 mulheres diabéticas foi selecionada. A amostra apresentou média x̄10 = 84 mmHg e desvio
padrão s10 = 9.1 mmHg. Faça o teste bilateral para testar as hipóteses do item (a), com 5% de nı́vel de significância.
Calcule o p-valor do teste. Qual a sua decisão?
c) A conclusão teria sido a mesma se tivéssemos escolhido um nı́vel de significância de 1%?
d) Construa um intervalo com 90% de confiança e outro com 95%. Compare. O que acontece quando aumentamos
a confiança do intervalo?

4. (Adaptado de Anderson et al. (2007)) Na Western University, a média histórica da pontuação nos exames para
obtenção de bolsas de estudo é 900. Presume-se que o desvio padrão da população é conhecido e igual a 180. Anu-
almente o vice-reitor usa uma amostra das notas para ver se a média se modificou.
a) Estabeleça as hipóteses.
b) Qual é a estimativa por intervalo de confiança de 95% da média populacional de pontuação nos exames se uma
amostra de 200 inscrições produziu média amostral de 935? Interprete.
c) Use o intervalo obtido no item (b) para testar a hipótese estabelecida em (a). Qual a sua conclusão?
d) Qual o valor p? Interprete.

5. (Adaptado de Anderson et al. (2007)) Uma rádio do estado anunciou que 90% dos hotéis da Serra Gaúcha estariam
lotados no final de semana do dia dos pais. A estação aconselhou os ouvintes a fazerem reserva antecipada para se
hospedar na Serra nestes dias. No sábado à noite uma amostra de 58 hotéis revelou que 49 diziam “sem vagas” e 9
diziam “temos vagas”. Qual é a sua reação à afirmação da rádio, depois de ver a evidência da amostra? Use 5% de

Page 91
DRAFT VERSION
nı́vel de significância.

6. Se desejássemos avaliar a variável ‘maneira de se vestir’, considerando a PUCRS como a população de interesse, qual
técnica de amostragem você utilizaria para retirar uma amostra? Por quê?

7. Uma empresa que fornece serviços de digitação (antiga datilografia) afirma que seus digitadores cometem, em média,
3 erros de digitação por página. Uma amostra aleatória de 25 páginas digitadas pela empresa foi selecionada, e neste
grupo foi contabilizado um total de 80 erros e um desvio padrão de 0.4 erro por página.
a) Quais as estimativas por ponto da média e do desvio padrão populacionais?
b) Utilizando nı́vel de significância de 5%, você aceita ou rejeita a hipótese apresentada pela empresa? Apresente o
desenvolvimento, a decisão estatı́stica (DE) e a conclusão experimental (CE).
c) Se um livro possui 150 páginas, qual o total de erros de digitação estimado?

8. Em uma turma de Estatı́stica Básica com N = 57, 23 alunos tiraram nota igual ou superior a 7 na P1, de um total
41 que realizaram a prova.
a) Qual a estimativa por ponto da proporção de pessoas que tiraram pelo menos a média na P1?
b) Sabendo que há 57 pessoas matriculadas e supondo que todas elas tivessem feito a prova, quantas pessoas espera-
se que tirassem pelo menos 7 na P1?
c) Faça um intervalo de confiança de 85% para proporção de pessoas que tiraram pelo menos a média na P1.

9. Em um lugar chamado Imaginationland, todas as pessoas por algum motivo conhecem os desvios padrão de todas as
variáveis já estudadas, mas desconhecem a média. Um grupo de esquerda, contrário ao governo de Imaginationland
e sem acesso aos dados oficiais a respeito das médias, realizou um estudo para estimar a média de importação de
idéias entre Imaginationland e Realand. Em 20 transações observaram um total de 35 idéias.
a) Qual a estimativa por ponto do número médio de idéias por transação?
b) Sabendo que o desvio padrão é de 2 idéias, encontre um intervalo de 90% de confiança para o número médio de
idéias por transação.

10. O instituto de pesquisa OPINAS avaliou o cenário eleitoral em certa região do Brasil em uma amostra de 500 eleito-
res, constatando que o candidato A tem 45% das intenções de votos enquanto seu concorrente, o candidato B, tem
37%.
a) Construa o intervalo de confiança 95% para a proporção de votos do candidato A.
b) Construa o intervalo de confiança 95% para a proporção de votos do candidato B.

11. O uso de drogas para a expansão da consciência foi relatado no livro As Portas da Percepção (1954) de Aldous
Huxley, que inspirou o nome da lendária banda The Doors. Seguindo esta linha, o psiquiatra Stanislav Grof cunhou
o termo “psicologia transpessoal”, falando dos estados ampliados de consciência. Em 1956, iniciou uma pesquisa no
Departamento de Psiquiatria da Faculdade de Medicina de Praga, onde trabalhava, e em 1967, em um instituto dos
Estados Unidos. A pedido de um laboratório da Suı́ça testou a substância alucinógena LSD em voluntários, com
o intuito de descobrir o potencial que a droga oferecia no tratamento de distúrbios psı́quicos. Após, desenvolveu a
técnica de respiração holotrópica, com o mesmo intuito de provocar alterações de consciência, uma vez que o LSD é
ilegal há muitas décadas.
a) Se em 30 dos 40 voluntários foram verificadas ondas do cérebro alteradas via eletroencefalograma, calcule a esti-
mativa por ponto da verdadeira proporção de pessoas que apresentariam esta alteração neurológica.
b) Calcule o intervalo de 95% de confiança para a verdadeira proporção de pessoas que apresentariam a alteração
neurológica citada no item anterior.

12. Uma fábrica que embala certo produto afirma que o conteúdo de suas embalagens contém em média 500g. Dados
históricos e estudos anteriores confirmam que os dados assumem uma distribuição normal com desvio padrão de 30g.
Um consumidor com bastante tempo livre resolveu fazer o teste, comprando 25 embalagens do produto e pesando-as.
A média dos pesos (massas, para ser fisicamente mais preciso) foi de 492g.
a) Qual o tipo de hipótese alternativa mais adequada?
b) Utilizando nı́vel de significância de 5%, a fábrica deve ser multada? Apresente o desenvolvimento, distribuição
utilizada, estatı́stica do teste e valor crı́tico. Dica: apresente tudo no desenho.

13. A fábrica de automóveis WMB afirma que seus carros têm um rendimento médio de 10.4 km/L. Uma locadora,
especializada em modelos da WMB observou uma amostra de 25 carros, obtendo uma média de 9.8 km/L e um
desvio padrão de 2.3 lm/L. Com α = 5% pode-se aceitar que os carros apresentam rendimento médio igual ao
declarado pela fábrica?

14. Um artigo do jornal Materials Engineering (1989, Vol. II, No. 4, pp. 275–281) descreve o resultado de testes de
tensão em 22 ligas U-700. A carga de rompimento foi medida em magapascais (MPa), e a amostra apresentou média
de 13.71 MPa e desvio padrão de 3.55 MPa.

Page 92
DRAFT VERSION
a) Quais são as estimativas por ponto da média e variância populacionais?
b) Construa um intervalo de 98% de confiança para a verdadeira média populacional.

15. Em uma amostra aleatória de 85 rolamentos de automóveis de certa fábrica, 10 apresentaram defeitos de fabricação.
a) Forneça a estimativa por ponto da verdadeira proporção de rolamentos defeituosos na fábrica.
b) Construa um intervalo de 91% de confiança para a verdadeira proporção de rolamentos defeituosos na fábrica.

16. Um grande conglomerado, com centenas de empresas, quer entender melhor sobre o processo de separação do lixo
em suas unidades. Para isso, selecionou 100 empresas do conglomerado e verificou que 82 delas faziam a separação
do lixo.
a) Qual a estimativa por ponto da proporção de empresas do conglomerado que separam o lixo?
b) Faça um intervalo de confiança de 95% para a proporção de empresas do conglomerado que separam o lixo.

17. Em uma amostra de 5 empresas brasileiras de importação de rolamentos, constatou-se que elas gastaram R$65,000,000.00
(sessenta e cinco milhões de reais) em compra de rolamentos da China.
a) Qual a estimativa por ponto do gasto médio das importações de rolamentos de empresas do ramo no Brasil?
b) Sabendo que o desvio padrão amostral de R$1,500,000.00, encontre um intervalo de 90% de confiança para o
gasto médio das importações de rolamentos de empresas do ramo no Brasil.

18. Um artigo de 1993 do Transactions of the American Fisheries Society apresentou o resultado de um estudo na
investigação da contaminação por mercúrio na região da Flórida (EUA). Uma amostra de 53 peixes foi observada,
de onde se calculou uma concentração média de mercúrio no tecido muscular de 0.5250 ppm e um desvio padrão de
0.3486 ppm. Encontre o intervalo de confiança de 95% para a média de mercúrio no tecido muscular dos peixes da
Flórida, sabendo que t52,0.025 ≈ 2.007.

19. Para uma população normal com variância conhecida, responda:


σ
a) Qual o nı́vel de confiança para o intervalo x ± 2.14 √ ?
n
b) Qual o valor de z que leva a um intervalo de 94% de confiança?

20. A pesquisa de intenção de votos do Datafolha com 3281 eleitores nos dias 14 e 15 de outubro apontou 47% de
intenção de votos para a candidata Dilma Rousseff. Encontre o intervalo de 84% de confiança para a verdadeira
proporção de votos da candidata.

Page 93
DRAFT VERSION

“ Se queres conhecer o passado, examina o presente que é o resultado;


se queres conhecer o futuro, examina o presente que é a causa.”
∼ Confúcio

5 Modelos Lineares
5.1 Correlação
Correlação é uma medida do (grau de) alinhamento entre duas v.a. quantitativas.
Intuitivamente pode-se considerar as nuvens de pontos cruzando x e y, apresentadas sem os eixos na
Figura 5.177 . Note que os alinhamentos perfeitos apresentam correlação +1 (ascendente) e −1 (descen-
dente). À medida que a nuvem de pontos fica menos linear, a correlação vai para zero.

Figura 5.1: Alguns exemplos de relacionamento entre duas variáveis quantitativas e suas correlações

5.1.1 ρ, a correlação universal


A correlação universal de duas v.a. X e Y é definida por
cov(X, Y )
ρ = cor(X, Y ) = , (108)
D(X)D(Y )
onde

cov(X, Y ) = E [(X − E(X))(Y − E(Y ))] (109)

é a covariância entre X e Y , D(X) e D(Y ) são respectivamente os desvios padrão78 de X e Y e

−1 ≤ ρ ≤ +1 (110)

0 ≤ |ρ| ≤ +1. (111)


77 [Link]
78 Seções 2.4.3, 3.3.1 e 3.4.1.

Page 94
DRAFT VERSION
Se |ρ| = +1, então existe uma relação linear da forma Y = β0 + β1 X. Se ρ = +1, β1 > 0; se ρ = −1,
β1 < 0. Se X é independente de Y , então ρ = 0, mas o contrário não é necessariamente verdadeiro79 .
No senso comum, ‘correlação’ possui uma ampla gama de significados. Até mesmo na Estatı́stica existe
uma pequena confusão entre as diferentes terminologias. O termo também se refere à correlação amostral,
geralmente calculada através da(o) (coeficiente de) correlação (amostral) (de Pearson), descrita(o) na
Seção 5.1.2. Nesta seção aborda-se ainda a correlação no caso da Regressão Pela Origem (RPO), denotada
por rRP O .
Exemplo 5.1. (Dados bivariados) Considere a idéia de estimar o número de garrafas de bebida a serem
geladas dependendo da temperatura máxima do dia. Seja X: ‘temperatura máxima do dia em ◦ C’ e Y :
‘número de garrafas de bebida consumidas’, observadas conforme Tabela 5.1.

i xi yi i xi yi i xi yi
1 29.5 145 11 28.5 183 21 40.9 233
2 31.3 170 12 28.0 158 22 28.6 169
3 34.7 167 13 36.7 181 23 36.1 192
4 40.4 244 14 31.5 123 24 27.1 106
5 28.4 159 15 38.1 223 25 29.5 170
6 40.3 195 16 33.5 176 26 31.6 167
7 41.1 225 17 37.2 196 27 25.2 133
8 36.2 206 18 41.9 238 28 31.5 138
9 35.7 200 19 31.5 184 29 39.8 199
10 26.1 134 20 38.2 213 30 30.8 172

Tabela 5.1: Temperatura máxima do dia (X, em ◦ C) e Consumo de bebida (Y , em # garrafas)

Um gráfico de dispersão80 pode ajudar a explorar o comportamento da temperatura e garrafas consu-


midas. O RStudio pode ajudar.


240




220


200

● ●
● ●

● ●
180


gar



● ● ●
● ●
160

●●


140


● ●


120

25 30 35 40

temp

Figura 5.2: Dispersão de X e Y

79 Sob certas condições de regularidade – e.g. normalidade – a recı́proca é verdadeira.


80 Seção 2.6.5.

Page 95
DRAFT VERSION
> # Lendo o arquivo '[Link]' direto do link
> dr <- [Link]('[Link] head=T)
> plot(dr)
> summary(dr)

temp gar
Min. :25.20 Min. :106.0
1st Qu.:29.50 1st Qu.:161.0
Median :32.55 Median :178.5
Mean :33.66 Mean :180.0
3rd Qu.:37.88 3rd Qu.:199.8
Max. :41.90 Max. :244.0

5.1.2 r, (coeficiente de) correlação (amostral) (de Pearson)


O coeficiente de correlação (amostral) (de Pearson), denotado por r, pode ser obtido por qualquer uma
das equações a seguir:
n   
1 X xi − x̄ yi − ȳ
r = (112)
n i=1 sx sy

P
(xi − x̄)(yi − ȳ)
r = pP P (113)
(xi − x̄)2 (yi − ȳ)2

P P P
n xi yi − xi yi
r = p , (114)
x2i − ( xi )2 ][n yi2 − ( yi )2 ]
P P P P
[n
onde
n n
1X 1X
x̄ = xi , s2x = (xi − x̄)2 ,
n i=1 n i=1
n n
1X 1X
ȳ = yi , s2y = (yi − ȳ)2 .
n i=1 n i=1
Note pela Equação (112) que r é uma média dos produtos dos pares ordenados (xi , yi ) padronizados,
com i ∈ {1, 2, . . . , n}. Se os pares de produto positivo predominarem, r será positivo. Se os pares de
produto negativo predominarem, r será negativo. Esta estrutura é chamada de momento-produto. A
Equação (113) remete à definição (108), enquanto a Equação (114) é útil para a realização dos cálculos.
Exemplo 5.2. (Correlação de Pearson) Considere novamente os dados do Exemplo 5.1.
O grau de alinhamento das variáveis pode ser estimado pelo coeficiente de correlação de Pearson,
bastando calcular X X
x = 1009.9, x2 = 34729.55,
X X
y = 5399, y 2 = 1006663,
X
xy = 186087.7, n = 30

e substituir na Equação (114), resultando em

30 × 186087.7 − 1009.9 × 5399


r = p
[30 × 34729.55 − (1009.9)2 ][30 × 1006663 − (5399)2 ]
130180.9
= √
21988.49 × 1050689
r ≈ 0.85647063.

Page 96
DRAFT VERSION
> # Lendo o arquivo '[Link]' direto do link
> attach([Link]('[Link] head=T))
> cor(temp,gar) ao 'cor'
# Pela funç~

[1] 0.8564706

5.1.3 Teste para ρ


Da mesma forma que foram realizados testes de hipótese para a média (H0 : µ = µ0 ) e proporção
(H0 : π = π0 ), usualmente testa-se a significância de outros parâmetros universais, tal como a correlação
(H0 : ρ = ρ0 ). O teste básico é comparar ρ com zero, que indica ausência completa de alinhamento entre
as variáveis. Assim, testa-se H0 : ρ = 0 (não há correlação) vs H1 : ρ 6= 0 (há correlação), denotado por

H0 : ρ = 0
.
H1 : ρ 6= 0

Se considerarmos o modelo completo na forma β0 na forma Y = β0 + β1 X, então sob H0

r
(n − 2)
T =r ∼ tn−2 . (115)
1 − r2
Exemplo 5.3. (Verificando o alinhamento no modelo completo) Considere novamente as informações
apresentadas no Exemplo 5.2. Pode-se testar

H0 : ρ = 0
H1 : ρ 6= 0

considerando o modelo completo Y = β0 + β1 X, implicando em T ∼ t30−2 ≡ t28 e que sob H0 resulta em


r
(30 − 2)
T = 0.8564706 ≈ 8.780.
1 − 0.85647062

> n <- 30
> r <- cor(temp,gar)
> (Tt <- r*sqrt((n-2)/(1-r^2)))

[1] 8.779647

> (p_value <- 2*pt(-abs(Tt),n-2))

[1] 1.568402e-09

> [Link](temp,gar) # Funç~


ao que realiza o teste de hipótese

Pearson's product-moment correlation

data: temp and gar


t = 8.7796, df = 28, p-value = 1.568e-09
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
0.7176348 0.9298311
sample estimates:
cor
0.8564706

Page 97
DRAFT VERSION
5.1.4 ρRP O e rRP O , a correlação na Regressão Pela Origem
Existe um caso especial de cálculo de correlação chamado Regressão Pela Origem (RPO) – descrito
detalhadamente na Seção 5.2.1 – que pode ser omitido em uma primeira leitura. Nestes casos pode-se
calcular rRP O através da expressão

sP
ŷi2
rRP O = . (116)
yi2
P

Exemplo 5.4. (Correlação na RPO) Considere as informações do Exemplo 5.2. Pode-se calcular

997094.2 √
r
rRP O = = 0.9904945 ≈ 0.9952359.
1006663
P 2
Para detalhes do cálculo de ŷi vide Exemplo 5.10.
,

Teste para ρRP O

No caso do modelo RPO ou ‘sem intercepto’, no qual β0 = 0, na forma Y = β1 X + ε, as hipóteses são



H0 : ρRP O = 0
.
H1 : ρRP O 6= 0
Sob H0 , a estatı́stica do teste é

s
(n − 1)
TRP O = rRP O 2 ∼ tn−1 . (117)
1 − rRP O

Exemplo 5.5. (Verificando o alinhamento no modelo RPO) Considere as informações do Exemplo 5.4.
Pode-se testar
No caso do modelo RPO na forma Y = β1 X ocorre TRP O ∼ t30−1 ≡ t29 , que sob H0 resulta em
r
(30 − 1)
TRP O = 0.9952359 ≈ 54.972.
1 − 0.99523592

> n <- 30
> r_rpo <- 0.9952359
> (T_rpo <- r_rpo*sqrt((n-1)/(1-r_rpo^2)))

[1] 54.97149

> (p_value <- 2*pt(-abs(T_rpo),n-1))

[1] 7.072562e-31

5.2 Regressão Linear Simples


A regressão linear simples é um conjunto de métodos utilizado para ajustar uma reta81 a uma nuvem de
pontos. Esta nuvem de pontos é formada por pares ordenados (xi , yi ). A aplicabilidade é imediata, pois
consegue-se uma regra entre uma variável independente (usualmente denotada por X) e uma variável
dependente (usualmente Y ). A qualidade do ajuste depende do grau de alinhamento entre X e Y .
Conforme apresentado na Seção 5.1, sabe-se que se |ρ| = +1, então existem constantes β0 e β1 tal
81 Veja o Apêndice D para maiores detalhes.

Page 98
DRAFT VERSION
que Y = β0 + β1 X. Na prática, porém, é bastante improvável encontrarmos variáveis com alinhameto
perfeito. Por este motivo considera-se o caso geral |ρ| < +1, descrito na forma

Y = β0 + β1 X + ε. (118)

Na linguagem usual denota-se β0 por coeficiente linear, termo independente ou intercepto. β1 é conhecido
como coeficiente angular. O termo de erro ε aparece devido ao fato de os pontos não se alinharem
perfeitamente. Assim supõe-se que os erros se distribuam normalmente com média zero e variância σε2 ,
i.e.,

ε ∼ N (0, σε2 ). (119)

A Figura 5.3 ilustra os casos de alinhamento perfeito (ε = 0) e com ruı́do (ε ∼ N (0, σε2 )), indicado pelas
linhas verticais. A distribuição de Y condicionada em X é Y |X = x ∼ N (β0 + β1 x, σε2 ).

(a) ε = 0 (b) ε ∼ N (0, σ 2 )

Figura 5.3: Alinhamento perfeito (Y = β0 + β1 X) e alinhamento com ruı́do normal (Y = β0 + β1 X + ε)

5.2.1 Equação da reta de regressão


A Equação (118) refere-se ao modelo universal, i.e., construı́do com todos os N pares ordenados do
universo. Na maioria dos casos práticos, entretanto, trabalha-se com amostras, tornando-se necessário
estimar os valores de β̂0 e β̂1 . O método dos Mı́nimos Quadrados (Ordinários) é utilizado para calcular
estas estimativas. O princı́pio do método é minimizar a soma de quadrado dos erros, i.e.,
n
X
minimizar ε2i . (120)
i=1

Basicamente utiliza-se εi = yi − β0 − β1 xi na Equação (120) e deriva-se em relação a β0 e β1 , fazendo


cada uma das derivadas parciais igual a zero82 .
As estimativas por mı́nimos quadrados para o modelo Y = β0 + β1 X + ε são dadas por
P P P
n xi yi − xi yi
β̂1 = P 2 P (121)
n xi − ( xi ) 2
e

β̂0 = ȳ − β̂1 x̄. (122)


82 Para maiores detalhes, veja Morettin and Bussab (2008) e DeGroot and Schervish (2002).

Page 99
DRAFT VERSION
Exemplo 5.6. (Equação da reta por MQO para Y = β0 + β1 X + ε) A partir das Equações (121), (122)
e das informações do Exemplo 5.2, pode-se calcular
30 × 186087.7 − 1009.9 × 5399 130180.9
β̂1 = 2
= ≈ 5.9204
30 × 34729.55 − (1009.9) 21988.49
e
5399 1009.9
β̂0 = − 5.9204 × ≈ −19.3341.
30 30
Assim, se estiver previsto 39 ◦ C para amanhã, espera-se o consumo de

ŷ = −19.3341 + 5.9204 × 39 = 211.5619 ≈ 212


garrafas de bebida em volta da piscina.
,

> summary(lm(gar ~ temp)) # Facilita duas barbaridades

Call:
lm(formula = gar ~ temp)

Residuals:
Min 1Q Median 3Q Max
-44.159 -8.965 3.582 10.810 33.602

Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) -19.3341 22.9437 -0.843 0.407
temp 5.9204 0.6743 8.780 1.57e-09 ***
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 18.26 on 28 degrees of freedom


Multiple R-squared: 0.7335, Adjusted R-squared: 0.724
F-statistic: 77.08 on 1 and 28 DF, p-value: 1.568e-09

Regressão Pela Origem (RPO)

Existem casos em que há razões teóricas para supor Y = 0 quando x = 0. Nestas situações cabe
definir uma Regressão Pela Origem 83 (RPO), i.e., assume-se a priori que β0 = 0. A estimativa por
mı́nimos quadrados para o modelo Y = β1 X + ε é dada por
P
xi yi
β̂1 = P 2 . (123)
xi

Exemplo 5.7. (Churras) Todas as pessoas que possuem 0 ou 1 no segundo dı́gito da carteira de identidade
sabem que para um bom churrasco deve-se comprar meio quilo de carne por pessoa. Assim, pode-se definir
o modelo
Y = 0.5x,
onde x é o número de participantes e Y é a quantidade de carne a ser adquirida. Note que Y = 0 quando
x = 0, i.e., quando não há pessoas para o churras, o ideal é não comprar carne.
,
Exemplo 5.8. (Equação da reta por MQO para Y = β1 X + ε) A partir da Equação (123) e das
informações do Exemplo 5.2, pode-se calcular
186087.7
β̂1 = ≈ 5.358195.
34729.55
83 Para mais detalhes sobre esta classe de modelos sugere-se a leitura de Eisenhauer (2003).

Page 100
DRAFT VERSION
Assim, se estiver previsto 39 ◦ C para amanhã, espera-se o consumo de

ŷ = 5.358195 × 39 = 208.9696 ≈ 209


garrafas de bebida em volta da piscina. Note que Y = 0 quando x = 0, tal como no caso do Exemplo 5.7.

> summary(lm(gar ~ temp - 1)) # -1 indica o modelo sem intercepto

Call:
lm(formula = gar ~ temp - 1)

Residuals:
Min 1Q Median 3Q Max
-45.783 -11.262 3.533 12.008 30.291

Coefficients:
Estimate Std. Error t value Pr(>|t|)
temp 5.35819 0.09747 54.97 <2e-16 ***
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 18.16 on 29 degrees of freedom


Multiple R-squared: 0.9905, Adjusted R-squared: 0.9902
F-statistic: 3022 on 1 and 29 DF, p-value: < 2.2e-16

5.2.2 Análise de diagnóstico


A análise de diagnóstico consiste na avaliação da qualidade dos modelos ajustados de acordo com de-
terminadas métricas. A rigor não é recomendado tirar conclusões de um modelo sem antes avaliar sua
qualidade, tal como apresentado nos Exemplos 5.6 e 5.8. A sequência de testes e avaliações sugeridas a
seguir não esgotam as possibilidades de diagnóstico, mas podem ser consideradas como avaliações básicas
para qualquer modelo linear.

Teste para β1

O teste para β1 é fundamental na análise de diagnóstico. É com ele que decide-se a respeito da
presença ou ausência de relação linear entre X e Y . Particularmente no caso da regressão linear simples,
os testes para β1 e ρ84 são equivalentes. As hipóteses do teste para β1 são

H0 : β1 = β1∗

.
H1 : β1 6= β1∗
No caso do modelo completo Y = β0 + β1 X + ε, sob H0

β̂1 − β1∗
T1 = ∼ tn−2 , (124)
ep(β̂1 )

onde
s sP
n
σ̂ 2 (yi − ŷi )2 /(n −
i=iP 2)
ep(β̂1 ) = = n 2
. (125)
Sxx i=i (xi − x̄)

Apesar do uso do valor genérico β1∗ , é usual testar H0 : β1 = 0 (não há correlação, ou X não explica
Y linearmente) vs H1 : β1 6= 0 (há correlação, ou X explica Y linearmente), tal como no teste para
ρ. A medida ep(β̂1 ) é o erro padrão de β̂1 , que depende das distâncias entre os valores observados yi e
os valores estimados pelo modelo, denotados por ŷi . Os valores estimados pelo modelo são obtidos por
ŷi = β̂0 + βˆ1 xi .
84 Seção 5.1.4

Page 101
DRAFT VERSION
Exemplo 5.9. (Teste para β1 em Y = β0 + β1 X + ε) Considere as informações dos Exemplos 5.2, 5.3
e 5.6. Pode-se testar H0 : β1 = 0 vs H1 : β1 6= 0 calculando-se inicialmente ŷi = β̂0 + βˆ1 xi por

ŷ1 = −19.3341 + 5.9204 × 29.5 = 155.3180


ŷ2 = −19.3341 + 5.9204 × 31.3 = 165.9748
..
.

ŷ30 = −19.3341 + 5.9204 × 30.8 = 163.0146.

Assim,
30
X
(yi − ŷi )2 = (145 − 155.3180)2 + (170 − 165.9748)2 + . . . + (172 − 163.0146)2 = 9332.152
i=i

e
30  2  2
X
2 1009.9 1009.9
(xi − x̄) = 29.5 − + . . . + 30.8 − = 732.9497.
i=i
30 30

Pela Equação (125) o erro padrão de β̂1 é dado por


r
9332.152/(30 − 2)
ep(β̂1 ) = ≈ 0.6743336,
732.9497
que sob H0 resulta em
5.9204 − 0
T1 = ≈ 8.780.
0.6743336
Pela linha ν = 30 − 2 = 28 da Tabela t (pg. 121) sabe-se que P r(T > 8.780) < 0.0005 = P r(T >
3.674), i.e., p = 2P r(T > 8.780) < 2 × 0.0005 = 0.001. Pelo nomograma da Figura 3.7b (pg. 64)
verifica-se uma considerável significância, onde p < 1 − 0.999999 = 0.000001. O p calculado via software
resulta em p = 7.842031 × 10−10 = 0.0000000007842031.
,
Note a equivalência entre os testes para ρ (Exemplo 5.3) e β1 (Exemplo 5.9). No caso da RPO
Y = β1 X + ε, sob H0

β̂1 − β1∗
T1 = ∼ tn−1 , (126)
ep(β̂1 )
onde
s sP
n
σ̂ 2 − ŷi )2 /(n
i=i (yiP − 1)
ep(β̂1 ) = = n 2 . (127)
Sxx i=i xi

Exemplo 5.10. (Teste para β1 em Y = β1 X + ε) Considere as informações dos Exemplos 5.2, 5.4 e
5.5. Pode-se testar H0 : β1 = 0 vs H1 : β1 6= 0 calculando-se inicialmente ŷi = βˆ1 xi por

ŷ1 = 5.358195 × 29.5 = 158.0668


ŷ2 = 5.358195 × 31.3 = 167.7115
..
.

ŷ30 = 5.358195 × 30.8 = 165.0324.

Assim,
30
X
(yi − ŷi )2 = (145 − 158.0668)2 + (170 − 167.7115)2 + . . . + (172 − 165.0324)2 = 9568.823.
i=i

Page 102
DRAFT VERSION
Pela Equação (127), o erro padrão de β̂1 é dado por
r
9568.823/(30 − 1)
ep(β̂1 ) = ≈ 0.09747218,
34729.55
que sob H0 resulta em
5.358195 − 0
T1 = ≈ 54.972.
0.09747218
Pela linha ν = 30 − 1 = 29 da Tabela t (pg. 121) sabe-se que P r(T > 54.972) < 0.0005 = P r(T >
3.674), i.e., p = 2P r(T > 54.972) < 2 × 0.0005 = 0.001. Pelo nomograma da Figura 3.7b (pg. 64)
verifica-se uma considerável significância, onde p < 1 − 0.999999 = 0.000001. O p calculado via software
resulta em p = 0.0000000.
,

Teste para β0

As hipóteses para o teste do intercepto β0 são

H0 : β0 = β0∗

.
H1 : β0 6= β0∗
Sob H0 ,

β̂0 − β0∗
T0 = ∼ tn−2 , (128)
ep(β̂0 )

onde
s  s Pn
x̄2 2 1 x̄2
  
1 i=i (yi − ŷi )
ep(β̂0 ) = σ̂ 2 + = + Pn 2
. (129)
n Sxx n−2 n i=i (xi − x̄)

A medida ep(β̂0 ) é o erro padrão de β̂0 . Novamente o padrão é testar H0 : β0 = 0. Caso o teste não
indique a rejeição de H0 , basta utilizar a RPO e recalcular β̂1 conforme Equação (123).
Exemplo 5.11. (Teste para β0 ) Considere novamente as informações dos Exemplos 5.2, ??, 5.3, 5.6 e
5.9. Pode-se testar H0 : β0 = 0 vs H1 : β0 6= 0 calculando
s
(1009.9/30)2
 
9332.152 1
ep(β̂0 ) = + ≈ 22.94372,
30 − 2 30 732.9497
que sob H0 resulta em
−19.3341 − 0
T0 =≈ −0.843.
22.94372
Pela linha ν = 30 − 2 = 28 da Tabela t (pg. 121) sabe-se que 0.10 < P r(T > 0.843) < 0.25, i.e.,
0.20 < p < 0.50. O nomograma da Figura 3.7b (pg. 64) indica p > 0.05. O p calculado via software
resulta em p = 0.4065509.
,

Page 103
DRAFT VERSION
Análise dos resı́duos

Resı́duo é a diferença entre o valor observado (yi ) e o valor estimado por um modelo (ŷi ), a partir
de uma amostra. Quanto menor esta diferença, melhor será o ajuste do modelo aos dados, podendo-se
obter resı́duo zero no caso particular em que todos os pontos estão sobre a curva (Figura 5.3a).
Como existe a suposição ε ∼ N (0, σε2 ) no universo, espera-se que os resı́duos tenham distribuição
aproximadamente normal com média zero. Para validar o modelo, porotanto, procede-se com testes do
hipótese para avaliar H0 : a distribuição é normal e H0 : µε = 0. No caso de RPO, os resı́duos em geral
não possuem média zero, uma vez que a linha da regressão é forçada a passar pela origem, distanciando-se
do ajuste ótimo.
Além dos testes utiliza-se usualmente o qq-plot, que indica graficamente o quão próximos os resı́duos
estão de uma normal teórica. A Figura 5.4 apresenta gráficos de qq-plot para diferentes distribuições de
probabilidade. Na Figura 5.4a é possı́vel notar um ajuste bastante adequado aos dados simulados a partir
de uma distribuição normal teórica. Na Figura 5.4b estão os dados simulados de uma distribuição t, cujas
caudas pesadas aparecem descoladas da reta nos extremos. A distribuição de Poisson, apresentada na
Figura 5.4c, é uma distribuição discreta e fica nitidamente mal ajustada à reta teórica. O último exemplo
(Figura 5.4d) é de uma distribuição qui-quadrado, com assimetria explı́cita no gráfico.

(a) Normal (b) t

(c) Poisson (d) Qui-quadrado

Figura 5.4: QQ-plot para diferentes distribuições

Page 104
DRAFT VERSION
Exemplo 5.12. (Resı́duos) Dos Exemplos 5.6 e 5.8 podem-se ajustar qq-plots como na Figura 5.5.

(a) RPO, Y = 5.3582x (b) Completo, Y = −19.3341 + 5.9204x

Figura 5.5: QQ-plots

Coeficiente de Determinação r2

O coeficiente de determinação é uma medida de avaliação da qualidade do ajuste de um modelo. O


princı́pio é comparar a Soma de Quadrado dos Resı́duos do modelo ajustado (SQRmodelo ) com a Soma
de Quadrado dos Resı́duos do modelo nulo (SQRmodelo nulo ) através da expressão

(yi − ŷ)2
P
2 SQRmodelo
r =1− =1− P . (130)
SQRmodelo nulo (yi − ȳ)2

O modelo nulo é um modelo de referência, geralmente ȳ. Usualmente define-se r2 como a proporção
da variação de Y que é explicada ajustando-se um particular modelo que depende de X. No caso da
regressão linear simples, o coeficiente de determinação é dado pelo quadrado do coeficiente de correlação
de Pearson, sendo simplesmente r2 .
Uma caracterı́stica importante é que a magnitude de r2 depende da amplitude de variação do X,
conforme Figura 5.6a. Anscombe (1973) sugeriu quatro conjuntos de dados com mesma média de X e Y,
porém com comportamentos bem diferentes, conforme Figura 5.6b. A conclusão de Anscombe é que um
r2 alto não assegura uma relação válida, portanto deve-se sempre avaliar o r2 juntamente com o gráfico
de dispersão.

Page 105
DRAFT VERSION

12

12

10

10

● ● ●
● ● ●
● ●

y1

y2
● ●

8

● ●

6

● ●

4

5 10 15 5 10 15

x1 x2

● ●

12

12
10

10
● ●

y3

y4
8

8
● ●


● ●

● ●

6
● ●

● ●

4
5 10 15 5 10 15

x3 x4

(a) r2 para diferentes amplitudes de X (b) Conjuntos de dados de Anscombe

Figura 5.6: Dispersão de X e Y

> summary(anscombe) # Medidas de posiç~


ao

x1 x2 x3 x4 y1
Min. : 4.0 Min. : 4.0 Min. : 4.0 Min. : 8 Min. : 4.260
1st Qu.: 6.5 1st Qu.: 6.5 1st Qu.: 6.5 1st Qu.: 8 1st Qu.: 6.315
Median : 9.0 Median : 9.0 Median : 9.0 Median : 8 Median : 7.580
Mean : 9.0 Mean : 9.0 Mean : 9.0 Mean : 9 Mean : 7.501
3rd Qu.:11.5 3rd Qu.:11.5 3rd Qu.:11.5 3rd Qu.: 8 3rd Qu.: 8.570
Max. :14.0 Max. :14.0 Max. :14.0 Max. :19 Max. :10.840
y2 y3 y4
Min. :3.100 Min. : 5.39 Min. : 5.250
1st Qu.:6.695 1st Qu.: 6.25 1st Qu.: 6.170
Median :8.140 Median : 7.11 Median : 7.040
Mean :7.501 Mean : 7.50 Mean : 7.501
3rd Qu.:8.950 3rd Qu.: 7.98 3rd Qu.: 8.190
Max. :9.260 Max. :12.74 Max. :12.500

> sqrt((colMeans(anscombe^2)-(colMeans(anscombe))^2)*11/10) # Desvios padr~


ao

x1 x2 x3 x4 y1 y2 y3 y4
3.316625 3.316625 3.316625 3.316625 2.031568 2.031657 2.030424 2.030579

Page 106
DRAFT VERSION
Exemplo 5.13. (Coeficiente de determinação do modelo completo) Primeiramente calcula-se a SQRmodelo nulo
por
30   2   2
X
2 5399 5399
(yi − ȳ) = 145 − + . . . + 172 − = 35022.97.
i=i
30 30
Do Exemplo 5.9 sabe-se que
30
X
(yi − ŷi )2 = 9332.152,
i=i

permitindo que se obtenha


9332.152
r2 = 1 − ≈ 0.7335419.
35022.97
Note que do Exemplo 5.2 pode-se calcular diretamente r2 = 0.85647062 ≈ 0.7335419.

5.3 Regressão Logı́stica


A regressão logı́stica é um tipo de Modelo Linear Generalizado (MLG) utilizado para modelar resultados
categóricos.

5.3.1 Bivariada
A regressão logı́stica bivariada é utilizada para modelar dados binários, i.e., que possuem resultados
dicotômicos. Usualmente rotula-se 1 para ‘sucesso’ (ocorrência do evento de interesse) e 0 para ‘fracasso’.
Rotular deste forma é conveniente pois a soma da coluna que contém esta informação resulta no total
de sucessos. Seja

π(x) = P r(Y = 1|X = x) = 1 − P r(Y = 0|X = x), x = (x1 , . . . , xp ).

O modelo de regressão logı́stico (binomial) é

exp(α + β1 x1 + · · · + βp xp )
π(x) = . (131)
1 + exp(α + β1 x1 + · · · + βp xp )

O log odds, também chamado de logito, é a função de ligação com a relação linear

π(x)
logit [π(x)] = log = α + β1 x 1 + · · · + βp x p (132)
1 − π(x)

5.3.2 Multivariada Nominal


P
Seja Y uma variável resposta com J categorias. Seja πj (x) = P r(Y = j|X = x) com j πj (x) = 1. O
modelo de regressão logı́stico multinomial para a j-ésima categoria é

exp(αj + βj0 x)
πj (x) = . (133)
1 + exp(αj + βj0 x)

O log odds, também chamado de logito, é a função de ligação com a relação linear

πj (x)
log = αj + βj0 x, j = 1, . . . , J − 1. (134)
πJ (x)

EXERCÍCIOS EXTRAS

Page 107
DRAFT VERSION
1. Um corretor-cientista percebeu um alinhamento razoável entre a metragem quadrada (x) dos imóveis que vende e o
preço de imóveis (y) em localizações próximas, e ajustou um modelo linear entre x e y com base em 8 apartamentos
do seu portfolio. Encontrou a equação

f (x) = y = 2192.04x − 14401.57.

a) O corretor calculou uma correlação de 0.9586. Faça o teste de hipóteses apropriado com α = 0.05 e interprete o
coeficiente de correlação.
b) Interprete o coeficiente angular no contexto do problema.
c) Se um cliente deste corretor pedisse R$150, 000.00 por um apartamento de 55m2 , você acharia que o preço está
adequado? Justifique.

2. É esperado que a massa muscular de uma pessoa diminua com a idade. Para estudar essa relação, uma nutricionista
selecionou 18 mulheres, com idade entre 40 e 79 anos, e observou em cada uma delas a idade (X) e a massa muscular
(Y), resultando na reta de regressão
y = −0.4x + 55

a) Se a correlação de Pearson foi igual a −0.837, teste H0 : ρ = 0 com α = 5%.


b) Considerando a reta fornecida, estime a massa muscular média de mulheres com 60 anos.
c) Interprete o coeficiente angular no contexto do problema.

Page 108
DRAFT VERSION
3. Considere as notas de 10 alunos em duas provas de certa disciplina, apresentadas na tabela abaixo.

P1 (x) 2.0 3.2 4.0 4.0 5.0 5.6 7.0 8.3 9.3 10.0
P2 (y) 3.0 5.0 6.0 5.0 7.0 8.0 7.0 8.0 8.0 9.6

(a) Modelo com intercepto (b) Modelo sem intercepto

a) Calcule e teste a significância da correlação amostral com α = 1%.


b) Compare os valores Multiple R-Squared com a correlação calculada no item anterior. O que você observa?
c) A partir da análise de diagnóstico apresentada, escolha o melhor regressão e escreva na forma y = β̂0 + β̂1 x.
Justifique sua escolha.
d) Compare os testes para a correlação amostral e para β̂1 dos dois modelos. O que você observa?
e) Utilizando o modelo escolhido, calcule quanto espera-se que um aluno tire na P2 sendo que sua P 1 = 5.6.

Page 109
DRAFT VERSION
4. Seu Macedo desconfia que a venda diária de picolés da sua budega está linearmente relacionada com a temperatura
máxima do dia. Para isso ajustou dois modelos lineares a partir de 9 pares de observações, apresentados a seguir.

(a) Modelo com intercepto (b) Modelo sem intercepto

a) Teste a significância da correlação amostral com α = 5%.


b) A partir da análise de diagnóstico apresentada, escolha o melhor regressão e escreva na forma y = β̂0 + β̂1 x.
Justifique sua escolha.
c) Compare os testes para a correlação amostral e para β̂1 . O que você observa?
d) Utilizando o modelo escolhido, quantos picolés seu Macedo estima vender quando observar uma temperatura
máxima de 22 graus Celsius?
e) Se seu Macedo vendeu 340 picolés em um dia, qual a temperatura máxima esperada para aquele dia?

Page 110
DRAFT VERSION
5. Durante os eventos esportivos disponibilizam-se locais abertos para o público assistir aos jogos. O número de pessoas
que comparecem a estes locais (y) parece estar relacionado com a quantidade de chuva (x) observada no dia dos
jogos. Para avaliar esta relação, observou-se a precipitação e o público presente durante 7 dias em um certo local de
eventos.

(a) Modelo com intercepto (b) Modelo sem intercepto

a) Qual a sua decisão sobre H0 : ρ = 0 vs H1 : ρ 6= 0? Argumente.


b) Sugira um modelo, indicando-o na forma y = β̂0 + β̂1 x. Justifique indicando os testes de hipóteses utilizados,
juntamente com seus p-values (coluna Pr(>|t|)) e comparação dos qq-plots.
c) Interprete o coeficiente angular β̂1 no contexto do problema.
d) Se a previsão do tempo indica 12 mm de chuva, qual o público estimado para este dia utilizando o modelo
escolhido no item (b)?

Page 111
DRAFT VERSION
6. Um estudo apontou a nota média em certa disciplina (y) de 10 alunos em função do número de horas mensais de
estudo (x).

(a) Modelo com intercepto (b) Modelo sem intercepto

a) Qual a sua decisão sobre H0 : ρ = 0 vs H1 : ρ 6= 0? Argumente.


b) Sugira um modelo, indicando-o na forma y = β̂0 + β̂1 x. Justifique indicando os testes de hipóteses utilizados,
juntamente com seus p-values (coluna Pr(>|t|)).
c) Interprete o coeficiente angular β̂1 no contexto do problema.
d) Se uma pessoa estuda 15 horas por mês, qual sua nota média esperada nesta disciplina? Utilize o modelo escolhido
no item (b).

Page 112
DRAFT VERSION

“ Alguém que acredite em crescimento infinito


em um planeta finito
é louco ou economista.”
∼ David Frederick Attenborough

6 Números Índice
m número ı́ndice é uma medida de variação percentual média. É obtido através de um quociente
U expresso em percentual. Números ı́ndices indicam, portanto, variações de preços, quantidades e
valores85 de produtos ou cestas no tempo ou espaço.
Exemplo 6.1. (Variação temporal e espacial) Suponha que o preço de um certo livro tenha variado
conforme a Tabela 6.1.

Ano
Cidade
2014 2015
A R$ 20.00 R$ 22.00
B R$ 19.70 R$ 22.10
C R$ 21.00 R$ 25.50

Tabela 6.1: Variação temporal e espacial do preço de um livro

Variação temporal. Na cidade A, o ı́ndice de preço de 2015 em relação a 2014 é de

pA
2015 22.00
pA
2014,2015 = = = 110%,
pA
2014 20.00

i.e., o preço deste livro em 2015 é 110% − 100% = 10% superior ao seu preço em 2014 na cidade A.
Como exercı́cio, calcule e interprete a variação de 2014 para 2015 nas demais cidades.

Variação espacial. Em 2014, o ı́ndice de preço da cidade B em relação à cidade A é de

p2014 19.70
p2014
A,B =
B
2014 = = 98.5%,
pA 20.00

i.e., o preço deste livro na cidade B foi 100% − 98.5% = 1.5% inferior àquele praticado na cidade A em
2014. Como exercı́cio, calcule e interprete a variação entre as cidades B e C em relação à cidade A em
2014 e 2015.
,
Na abordagem temporal do Exemplo 6.1, o preço em 2014 é escolhido como base de referência,
também chamado de base de comparação ou ano-base. O ano de 2015 – cujo preço está sendo comparado
com a base de referência – é chamado de ano atual, não necessariamente o ano corrente.

85 valor = preço × quantidade.

Page 113
DRAFT VERSION
6.1 Índices Relativos ou Simples
Os ı́ndices relativos ou simples comparam preços, quantidades e valores de apenas um produto em dois
momentos distintos do tempo.

6.1.1 de Preço
pt
p0,t = (135)
p0

6.1.2 de Quantidade
qt
q0,t = (136)
q0

6.1.3 de Valor
vt pt qt
v0,t = = (137)
v0 p0 q0

Preço unitário (reais) Quantidade comprada


Produto
2008 (p0 ) 2009 (p1 ) 2010 (p2 ) 2008 (q0 ) 2009 (q1 ) 2010 (q2 )
Pão 1.20 1.26 1.30 300 330 360
Leite 1.70 1.80 2.00 150 150 180
Ovos 3.10 3.27 3.40 60 90 120
Carne 7.00 8.00 9.00 150 120 90

Tabela 6.2: Exemplo de uma cesta de produtos

Exemplo 6.2. (Índices relativos) Considere a cesta de produtos apresentada pela Tabela 6.2. O ı́ndice
relativo de preço da carne, de 2009 para 2010, é de
9.00
pcarne
2009,2010 = = 112.5%,
8.00
indicando um aumento de 112.5% − 100% = 12.5% no preço deste produto de 2009 para 2010. O ı́ndice
relativo de quantidade da carne de 2009 para 2010 é de

carne 90
q2009,2010 = = 75%,
120
indicando uma redução de 100% − 75% = 25% na quantidade de carne comprada de 2009 para 2010. O
ı́ndice relativo de valor da carne de 2009 para 2010 é de

carne 9.00 × 90
v2009,2010 = ≈ 84.38%,
8.00 × 120
indicando uma redução de 100% − 84.38% ≈ 15.62% no valor da carne de 2009 para 2010.
,

EXERCÍCIOS
1. Utilizando 2008 como ano-base e utilizando os produtos da Tabela 6.2, calcule:

a) O ı́ndice relativo de preço.


b) O ı́ndice relativo de quantidade.
c) O ı́ndice relativo de valor.

Page 114
DRAFT VERSION
6.2 Índices Agregativos Simples
Um ı́ndice é dito agregativo quando somam-se os preços, quantidades ou valores em uma cesta de pro-
dutos.

6.2.1 Índice Agregativo Simples (de Bradstreet)


De preço
P i
p
P
I0,t = P it ,
p0
onde pit é o preço do i-ésimo bem na época atual e pi0 é o preço do i-ésimo bem na época base.
De quantidade
P i
Q q
I0,t = P it ,
q0
onde qti é a quantidade do i-ésimo bem na época atual e q0i é a quantidade do i-ésimo bem na época base.
De valor
P i
v
I0,t = P it ,
V
v0
onde vti = pit qti é o valor do i-ésimo bem na época atual e v0i = pi0 q0i é o valor do i-ésimo bem na época
base.
Exemplo 6.3. (Índices agregativos simples) Suponha novamente a cesta de produtos da Tabela 6.2. O
ı́ndice agregativo de preço da cesta, de 2009 para 2010, é dado por
P 1.30 + 2.00 + 3.40 + 9.00
I2009,2010 = ≈ 109.56%,
1.26 + 1.80 + 3.27 + 8.00
indicando um aumento de 109.56% − 100% ≈ 9.56% no preço da cesta de produtos. O ı́ndice agregativo
de quantidade da cesta, de 2009 para 2010, é dado por
Q 360 + 180 + 120 + 90
I2009,2010 = ≈ 108.70%,
330 + 150 + 90 + 120
indicando um aumento de 108.70% − 100% ≈ 8.70% na quantidade da cesta de produtos. O ı́ndice
agregativo de valor da cesta, de 2009 para 2010, é dado por
V 1.30 × 360 + 2.00 × 180 + 3.40 × 120 + 9.00 × 90
I2009,2010 = ≈ 105.46%,
1.26 × 330 + 1.80 × 150 + 3.27 × 90 + 8.00 × 120
indicando um aumento de 105.46% − 100% ≈ 5.46% no valor da cesta de produtos.

6.2.2 Índice Médio Aritmético (de Sauerbeck)


De preço

pi0,t
P
P̄0,t = ,
n
onde pi0,t é o ı́ndice relativo simples de preço do i-ésimo produto e n é o número de itens.
De quantidade
P i
q0,t
Q̄0,t = ,
n
i
onde q0,t é o ı́ndice relativo simples de quantidade do i-ésimo produto e n é o número de itens.
De valor
P i
v0,t
V̄0,t = ,
n
i
onde v0,t = pi0,t q0,t
i
é o ı́ndice relativo simples de valor do i-ésimo produto e n é o número de itens.

Page 115
DRAFT VERSION
Exemplo 6.4. (Índices médios aritméticos) Suponha novamente os produtos da cesta apresentada na
Tabela 6.2. O ı́ndice médio aritmético de preço da cesta, de 2009 para 2010, é dado por
1.30 2.00 3.40 9.00
1.26 + 1.80 + 3.27 + 8.00
P̄2009,2010 = ≈ 107.69%,
4
indicando um aumento de 107.69% − 100% ≈ 7.69% no ı́ndice médio de preço da cesta de produtos. O
ı́ndice médio aritmético de quantidade da cesta, de 2009 para 2010, é dado por
360 180 120 90
330 + 150 + 90 + 120
Q̄2009,2010 = ≈ 109.36%,
4
indicando um aumento de 109.36% − 100% ≈ 9.36% no ı́ndice médio de quantidade da cesta de produtos.
O ı́ndice médio aritmético de valor da cesta, de 2009 para 2010, é dado por
1.30×360 2.00×180 3.40×120 9.00×90
1.26×330 + 1.80×150 + 3.27×90 + 8.00×120
V̄2009,2010 = ≈ 117.22%,
4
indicando um aumento de 117.22% − 100% ≈ 17.22% no ı́ndice médio de valor da cesta de produtos.

6.3 Índices Agregativos Ponderados


6.3.1 Índice (Ponderado) de Laspeyres ou da época base
De preço
O ı́ndice de preço de Laspeyres calcula o ı́ndice de preços ponderando-os pelas quantidades no ano-
base.
P i i
pt q0
LP 0,t =
pi0 q0i
P

De quantidade
O ı́ndice de quantidade de Laspeyres calcula o ı́ndice de quantidades ponderando-as pelos preços no
ano-base.
P i i
Q qp
L0,t = P it 0i
q0 p0
Exemplo 6.5. Suponha novamente a cesta de produtos da Tabela 6.2. O ı́ndice (ponderado) de preço
de Laspeyres, de 2009 para 2010, é dado por
1.30 × 330 + 2.00 × 150 + 3.40 × 90 + 9.00 × 120
LP
2009,2010 = = 109.01%.
1.26 × 330 + 1.80 × 150 + 3.27 × 90 + 8.00 × 120
O ı́ndice (ponderado) de quantidade de Laspeyres, de 2009 para 2010, é dado por
360 × 1.26 + 180 × 1.80 + 120 × 3.27 + 90 × 8.00
LQ
2009,2010 = = 97.42%.
330 × 1.26 + 150 × 1.80 + 90 × 3.27 + 120 × 8.00

6.3.2 Índice (Ponderado) de Paasche ou da época atual


De preço
O ı́ndice de preço de Paasche calcula o ı́ndice de preços ponderando-os pelas quantidades no ano
atual.
P i i
pq
P
P0,t = P it ti
p0 qt
De quantidade
O ı́ndice de quantidade de Paasche calcula o ı́ndice de quantidades ponderando-as pelos preços no
ano atual.
P i i
Q qp
P0,t = P it ti
q0 pt

Page 116
DRAFT VERSION
Exemplo 6.6. Suponha novamente a cesta de produtos da Tabela 6.2. O ı́ndice (ponderado) de preço
de Paasche, de 2009 para 2010, é dado por

P 1.30 × 360 + 2.00 × 180 + 3.40 × 120 + 9.00 × 90


P2009,2010 = = 108.25%.
1.26 × 360 + 1.80 × 180 + 3.27 × 120 + 8.00 × 90
O ı́ndice (ponderado) de quantidade de Paasche, de 2009 para 2010, é dado por

Q 360 × 1.30 + 180 × 2.00 + 120 × 3.40 + 90 × 9.00


P2009,2010 = = 96.74%.
330 × 1.30 + 150 × 2.00 + 90 × 3.40 + 120 × 9.00

6.3.3 Índice (Ponderado) de (Irving) Fisher


Também conhecido como ı́ndice de preço ideal, o ı́ndice (ponderado) de Fisher é a média geométrica
entre os respectivos ı́ndices de Laspeyres e Paasche.
De preço
q
P
F0,t = LP P
0,t P0,t

De quantidade
q
Q
F0,t = LQ Q
0,t P0,t

Exemplo 6.7. Novamente utilizando os dados da cesta de produtos da Tabela 6.2, calcula-se o ı́ndice
(ponderado) de preço de Fisher, de 2009 para 2010, por
P

F2009,2010 = 1.0901 × 1.0825 = 108.63%.

O ı́ndice (ponderado) de quantidade de Fisher, de 2009 para 2010, é dado por


Q

F2009,2010 = 0.9742 × 0.9674 = 97.08%.

EXERCÍCIOS EXTRAS
1. A ceia de natal é um momento importante para as famı́lias cristãs. É geralmente composta de certos produtos
tı́picos, como aves, frutas secas e doces. Abaixo estão os preços de alguns dos principais produtos que compõem a
ceia natalina, bem como suas variações de preço e quantidade ao longo de três anos.

Preço unitário (reais) Quantidade comprada


Produto
2007 (p0 ) 2008 (p1 ) 2009 (p2 ) 2007 (q0 ) 2008 (q1 ) 2009 (q2 )
Peru 44.98 48.31 56.17 2 2 1
Nozes 9.32 10.45 12.33 0.5 0.7 0.9
Cereja 8.11 9.50 11.12 0.1 0.2 0.2

Tabela 6.3: Cesta de produtos natalinos

Calcule:
a) O ı́ndice relativo de preços da cereja em 2009 com base em 2007.
b) O ı́ndice agregativo simples de quantidade da cesta de produtos da tabela acima em 2008, com base em 2007.
c) O ı́ndice relativo de valor da cereja em 2009, com base em 2007.
d) O ı́ndice ponderado de Fisher de quantidade da cesta de produtos da tabela acima em 2008, com base em 2007.

2. Considere os preços e quantidades apresentados na tabela abaixo.


a) O ı́ndice relativo de preço do Mumu em 2009, com base em 2008.
b) O ı́ndice agregativo simples de quantidade da cesta de produtos da tabela acima em 2010, com base em 2008.
c) O ı́ndice ponderado de Paasche de preço da cesta de produtos da tabela acima em 2010, com base em 2009.
d) O ı́ndice ponderado de Fisher de preço da cesta de produtos da tabela acima em 2010, com base em 2009.

Page 117
DRAFT VERSION

Preço unitário (reais) Quantidade comprada


Produto
2008 (p0 ) 2009 (p1 ) 2010 (p2 ) 2008 (q0 ) 2009 (q1 ) 2010 (q2 )
Ambrosia 1.75 1.89 2.90 11 11 13
Erva mate gold 7.03 7.58 8.20 2 3 3
Mumu 1.28 1.99 2.70 7 8 10

Tabela 6.4: Cesta de produtos gaudérios

Page 118
DRAFT VERSION

“ O pensamento é escravo da vida, e a vida, o bobo do tempo.


E o tempo, que toma conta do mundo inteiro, um dia há de parar.”
∼ William Shakespeare, 1597

7 Séries Temporais
ma série temporal é uma sequência de valores observada no tempo.
U
Exemplo 7.1. (Função forecast::[Link]) A função [Link] do pacote forecast oferece
um ajuste automático dos modelos ARIMA (Auto Regressive Integrated Moving Average) para séries
temporais univariadas.

> needs(forecast)
> par(mfrow=c(1,2))
> plot(WWWusage)
> fit <- [Link](WWWusage)
> plot(forecast(fit, h = 20))

EXERCÍCIOS
1. Rode o Exemplo 7.1 no seu ambiente computacional.

Page 119
DRAFT VERSION
Apêndices
A Tabelas
Tabela normal padrão N (0, 1)

Page 120
DRAFT VERSION
Tabela t

Page 121
DRAFT VERSION
Tabela Qui-quadrado χ2

Page 122
DRAFT VERSION
Tabela F de Fisher-Snedecor 10%

Page 123
DRAFT VERSION
Tabela F de Fisher-Snedecor 5%

Page 124
DRAFT VERSION
Tabela F de Fisher-Snedecor 2.5%

Page 125
DRAFT VERSION
Tabela F de Fisher-Snedecor 1%

Page 126
DRAFT VERSION
Tabela F de Fisher-Snedecor 0.5%

Page 127
DRAFT VERSION
B Respostas dos Exercı́cios (interminatus)
Capı́tulo 2 - Estatı́stica Descritiva
Seção 2.1

1. a) Quantitativa discreta
b) Quantitativa contı́nua
c) Quantitativa discreta
d) Quantitativa contı́nua
e) Qualitativa nominal
f) Qualitativa ordinal
g) Qualitativa nominal
h) Quantitativa contı́nua
i) Quantitativa contı́nua
j) Qualitativa ordinal
k) Quantitativa contı́nua
l) Qualitativa nominal
m) Quantitativa contı́nua

Seção 2.2

1. -4,1,3,5,7,9,10

2. a) Quantitativa discreta.
b) f3 = 9. 9 peças possuem 2 defeitos.
c) fr3 = 9/50 = 0.18. 18% das peças possuem 2 defeitos.
d) F4 = 44. 44 peças têm até 3 defeitos.
e) Fr5 = 49/50 = 0.98. 98% das peças tem até 4 defeitos.

3. a) fV I = 38. 38 paı́ses devem pagar 3 unidades monetárias.


b) frI = 21/173 ≈ 0.1214. 12.14% dos paı́ses devem pagar 25 unidades monetárias.
c) FII = 47. 47 paı́ses devem pagar 20 ou 25 unidades monetárias.
d) FrIII = 57/173 ≈ 0.3295. 32.95% dos paı́ses devem pagar 15, 20 ou 25 unidades monetárias.

4. a) Quantitativa contı́nua.
b) f r3 = 30/100 = 0.3. 30% dos alunos tem altura entre 1.60m (inclusive) e 1.70m (exclusive).
c) F4 = 92. 92 alunos têm altura até 1.80m (exclusive).
d) Fr2 = 0.15. 15% dos alunos tem altura até 1.60m.
e) `3 = 100 − 2 − 13 = 85.

5. Aguardando sugestões.

Seção 2.3

1. Aguardando sugestões.

Seção 2.4

1. a) 5.07%, 95.79%.
b) 1186/1539 ≈ 77.06%.
c) 30/3445 ≈ 0.87%.
d) Fumantes: 300+, pois fF = 412. A categoria de nı́vel de nicotina com maior representatividade entre os fumantes
é 300+. Não fumantes: 0 − 13, pois fN F = 3300. A categoria de nı́vel de nicotina com maior representatividade
entre os não fumantes é 0 − 13.

Nı́vel de cotinina (ng/mL) fF fr F fN F fr N F


0 14 78 0.0507 3300 0.9579
14 50 133 0.0864 72 0.0209
50 100 142 0.0923 23 0.0067
100 150 206 0.1339 15 0.0044
150 200 197 0.1280 7 0.0020
200 250 220 0.1429 8 0.0023
250 300 151 0.0981 9 0.0026
300 + 412 0.2677 11 0.0032
Total 1539 1.0000 3445 1.0000

2. a) São medidas-resumo, que auxiliam a avaliação de conjuntos de dados.


b) Dados ordinais possuem informação de ordenação, ao contrário dos dados nominais.
c) Vantagens: simplifica a interpretação pelo agrupamento em classes. Desvantagens: perda de informação, maior
complexidade nos cálculos de medidas descritivas.
d) Quando deseja-se ter a noção do quanto aquela classe está sendo representada em relação ao total.

Page 128
DRAFT VERSION
X Y
Média 24 145
Mediana 22.5 137.5
Amplitude 29 285
Variância 148 8400
Desvio padrão 12.1655 91.6515
Coeficiente de variação 0.507 0.632

e) São medidas que dividem um conjunto de dados em quatro partes iguais, cada uma contendo 25% (ou 1/4) dos
dados.
f) São medidas de tendência central. Média: para dados quantitativos. Mediana: para dados qualitativos ordinais.

3. Mediana.

4. a,b) TABELA ACIMA


c) No setor Y, pois 0.632 > 0.507.

5. P1 = 7.5 × 3 − (5 + 9) = 8.5.

6. a)

Média 14 dias 74.03


Mediana 14 dias 75.20
Média semana 1 73.54
Mediana semana 1 73.00
Média semana 2 74.51
Mediana semana 2 76.30

b)

Semana 1 Semana 2 14 dias


Chimarrão
f f rr f fr f fr
Frio 2 28.6% 1 14.3% 3 21.4%
Bom 4 57.1% 6 85.7% 10 71.4%
Pelando 1 14.3% 0 0.0% 1 7.1%

c) O chimarrão ficou bom em 71.4% das vezes.


d) Primeira semana: chimarrão ficou bom 57.1% das vezes. Segunda semana: 85.7% das vezes.

7. a) A idade média das pessoas que trabalham em casa é 34.75 anos. Mediana: metade das pessoas que trabalham
em casa tem 34.5 anos ou menos. Moda: 25 anos.
b) 25% das pessoas que trabalham em casa tem 26 anos ou menos. 75% das pessoas que trabalham em casa tem
mais de 26 anos.

c) Como a mediana encontrada no conjunto de idades de pessoas que trabalham em casa é 34.5 anos, muito próximo
da mediana da população (35 anos), não há indı́cios que pessoas que trabalham em casa sejam mais jovens ou
mais velhas. (Não testamos isto, estamos apenas investigando!)

8. a)

Cidade Rodovia
Média 25.05 29.99
Mediana 25.58 29.93
Moda 24.62 28.96

b) Aguardando sugestões.

9. a) Metade das meninas bulı́micas têm consumo calórico até 18.50, enquanto a outra metade têm consumo calórico
superior a este valor. Metade das meninas saudáveis têm consumo calórico até 33.45, enquanto a outra metade
têm consumo calórico superior a este valor.
b) Média bulı́micas: 19.23. Média saudáveis: 31.73.
c) O grupo das saudáveis, pois 0.21 > 0.17.

10. a) Quantitativa discreta. Itens b, c, d, e, f, soluções na tabela.

11. V, NSA, F (pois há crianças que não foram, pois moda e mediana iguais a zero), F.

Page 129
DRAFT VERSION
Bulı́micas Saudáveis
Média 19.23 31.73
Mediana 18.50 33.45
Desvio padrão 3.28 6.72
Coeficiente de variação 0.17 0.21

MEEM G1 MEEM G2
Média 13.88 22.13
Mediana 12.00 21.00
Moda 12.00 21 e 19
Amplitude 9.00 12.00
Variância populacional 10.86 15.61
Desvio padrão populacional 3.30 3.95
Variância amostral 12.41 17.84
Desvio padrão amostral 3.52 4.22
Coeficiente de variação 0.25 0.19

12. C

13. E

14. A e C

15. B

Seção 2.6

1. -

2. Aguardando sugestões.

Exercı́cios extras

1. V V V V F V

Capı́tulo 3 - Probabilidade
Seção 3.2

1. Aguardando sugestões.

2. Aguardando sugestões.

Exercı́cios extras

1. Ω = {M M M, M M F, M F M, F M M, M F F, F M F, F F M, F F F }. Brinde: |Ω| = 8.
4000
2. a) 10000
= 25 = 0.40
200 1
b) 10000
= 50 = 0.02
5100+3700
c) 10000
= 22
25
= 0.88
3700+400+500
d) 10000
= 23
50
= 0.46
5100 51
e) 10000
= 100 = 0.51
150000 3
3. a) 1400000
= 28 ≈ 0.1071
130000+100000 23
b) 1400000
= 140 ≈ 0.1643
1150000 23
c) 1400000
= 28
≈ 0.8214
15
4. a) 120
= 18 = 0.125
15+30+18
b) 120
= 21
40
= 0.525
7+12+5 1
c) 120
= 5 = 0.2
40 1
d) 120
= 3 = 0.3

5. a)

Page 130
DRAFT VERSION
3 1 25 5
b) P r(P rimeira) = 60
= 20
= 0.05. P r(T eceira) = 60
= 12
= 0.416
10+5 15
c) 25+1+5+10
= 41
= 0.36585
25+1+5+10
d) 50000 × 60
= 34167 pessoas

6. a) P r(V ∪ M ) = P r(V ) + P r(M ) − P r(V ∩ M ) = 0.55 + 0.30 − 0.2 = 0.65.


b) P r([V ∪ M ]c ) = 1 − 0.65 = 0.35.
25+23
7. a) 74
= 24
37
= 0.648
9
b) 74
= 0.1216
8+8 8
c) 74
= 37 = 0.216
4+12 8
d) 74
= 37 = 0.216
2+2 2
e) 74
= 37 = 0.054
62
8. a) 745
≈ 0.0832
238
b) 745
≈ 0.3195
2
c) 745
≈ 0.0027

9. a) P r(A ∪ B) = P r(A) + P r(B) − P r(A ∩ B) = 0.01 + 0.05 − 0.005 = 0.055


b) P r([A ∪ B]c ) = 1 − P r(A ∪ B) = 1 − 0.055 = 0.945
c) 1000 × [P r(B) − P r(A ∩ B)] = 1000 × [0.05 − 0.005] = 45 pessoas
217700
10. a) 338000
= 2177
3380
≈ 0.6441
15000 15
b) 338000
= 338 ≈ 0.0444
25200+27600
c) 338000
= 132
845
≈ 0.1562
27600+24000+20700+37800+41400+56000
d) 10000000
= 0.02075
560 14
11. a) 1000
= 25
= 0.56
720 18
b) 1000
= 25
= 0.72
60 3
c) 1000
= 50
= 0.06
200+80 7
d) 1000
= 25
= 0.28
55
12. a) 100
= 0.55
63
b) 100
= 0.63
9
c) 100
= 0.09
21+16
d) 100
= 0.37

13. D : Item defeituoso


P r(A) = 0.5 P r(D|A) = 0.01
P r(B) = 0.3 P r(D|B) = 0.02
P r(C) = 0.2 P r(D|C) = 0.03

a)

P r(A)P r(D|A)
P r(A|D) =
P r(A)P r(D|A) + P r(B)P r(D|B) + P r(C)P r(D|C)
0.5 × 0.01
=
0.5 × 0.01 + 0.3 × 0.02 + 0.2 × 0.03
5
=
17
≈ 0.294117647
b)

0.3 × 0.02 6
P r(B|D) = = ≈ 0.352941176
0.017 17

 
5 6 6
P r(C|D) = 1 − + = ≈ 0.352941176
17 17 17

1
14. P r({C}) = P r({K}) =
2

Page 131
DRAFT VERSION
a) Ω = {CCC, CCK, CKC, KCC, CKK, KCK, KKC, KKK}
b) RX = {0, 1, 2, 3}
 3
1 1 1 1 1
c) p(0) = P r(X = 0) = P r({KKK}) = × × = = = 0.125
2 2 2 2 8
 3  3  3
1 1 1 3
p(1) = P r(X = 1) = P r({CKK, KCK, KKC}) = + + = = 0.375
2 2 2 8
 3
1 3
p(2) = P r(X = 2) = P r({CCK, CKC, KCC}) = 3 = = 0.375
 2 8
1 3 3 1
p(3) = P r(X = 3) = P r({CCC}) = 1 − + + = = 0.125
8 8 8 8
1 3 3 1
d) E(X) = 0 × + 1 × + 2 × + 3 × = 1.5 (Por simetria)
8 8 8 8
1 3 3 1
E(X 2 ) = 02 × + 12 × + 22 × + 32 × = 3
8 8 8 8 √
√ √
r
3 3
q
D(X) = E(X 2 ) − [E(X)]2 = 3 − 1.52 = 0.75 = = ≈ 0.866025403
4 2
15. P r({C}) = 0.7, P r({K}) = 0.3
a) Ω = {CCC, CCK, CKC, KCC, CKK, KCK, KKC, KKK}
b) RX = {0, 1, 2, 3}
c) p(0) = P r(X = 0) = P r({KKK}) = 0.33 = 0.027

p(1) = P r(X = 1) = P r({CKK, KCK, KKC}) = 3 × 0.7 × 0.32 = 0.189

p(2) = P r(X = 2) = P r({CCK, CKC, KCC}) = 3 × 0.72 × 0.3 = 0.441

p(3) = P r(X = 3) = P r({CCC}) = 1 − (0.027 + 0.189 + 0.441) = 0.343


d) E(X) = 0 × 0.027 + 1 × 0.189 + 2 × 0.441 + 3 × 0.343 = 2.1

E(X 2 ) =√02 × 0.027 + 12√× 0.189 + 22 × 0.441 + 32 × 0.343 = 5.04


D(X) = 5.04 − 2.12 = 0.63 ≈ 0.793725393

16. P r({C}) = p, P r({K}) = 1 − p


a) Ω = {CCC, CCK, CKC, KCC, CKK, KCK, KKC, KKK}
b) RX = {0, 1, 2, 3}
c) p(0) = P r(X = 0) = P r({KKK}) = (1 − p)3

p(1) = P r(X = 1) = P r({CKK, KCK, KKC}) = 3p(1 − p)2

p(2) = P r(X = 2) = P r({CCK, CKC, KCC}) = 3p2 (1 − p)

p(3) = P r(X = 3) = P r({CCC}) = p3


d) E(X) = 0 × (1 − p)3 + 1 × 3p(1 − p)2 + 2 × 3p2 (1 − p) + 3 × p3 = 3p

E(X 2 ) = 02 × (1 − p)3 + 12 × 3p(1 − p)2 + 22 × 3p2 (1 − p) + 32 × p3 = 3p(1 + 2p)


q
D(X) = [3p(1 + 2p)] − [3p]2 = 3p(1 − p)
p

17. p = 1% = 0.01, n = 20
a) X ∼ B(20, 0.01)

p(x) = n 0.01x 0.9920−x



x
b) E(X) = 20 × 0.01 = 0.2
√ √
c) D(X) = 20 × 0.01 × 0.99 = 0.198 ≈ 0.4449719092
p(6) = P r(X = 6) = 20 0.016 0.9920−6 ≈ 3.3672588 × 10−8

d) 6
P r(X ≥ 1) = 1 − P r(X = 0) = 1 − 20 0.010 0.9920 = 1 − 0.81790694 ≈ 0.18209306

e) 0

18. λ = 4
a) X ∼ P(4)

b) E(X) = 4, D(X) = 4 = 2.
e−4 40
c) P r(X ≥ 1) = 1 − P r(X = 0) = 1 − ≈ 0.981684361
0!
1
19. f (x) = (x3 − 3.36x + 2.36), x ∈ [1, 2]
1.07

Page 132
DRAFT VERSION
a)
Z
1 x
F (x) = P r(X < x) = (t3 − 3.36t + 2.36) dt
11.07
 4 x
1 t 3.36t2
= − + 2.36t
1.07 4 2 1
 4   4 
1 x 1
= − 1.68x2 + 2.36x − − 1.68 × 12 + 2.36 × 1
1.07 4 4
 4 
1 x
F (x) = − 1.68x2 + 2.36x − 0.93
1.07 4

b) P r(1.4 < X < 1.7) = F (1.7) − F (1.4) = 0.294228972 − 0.038878504 ≈ 0.255350467


c)
Z 2
1
E(X) = x(x3 − 3.36x + 2.36) dx
1.07 1
Z 2
1
= (x4 − 3.36x2 + 2.36x) dx
1.07 1
 5 2
1 x 3.36x3 2.36x2
= − +
1.07 5 3 2 1
 5   5 
1 2 1
= − 1.12 × 23 + 1.18 × 22 − − 1.12 × 13 + 1.18 × 12
1.07 5 5
1
= [2.16 − 0.26]
1.07

190
E(X) = ≈ 1.775700935
107

1
Z 2
E(X 2 ) = x2 (x3 − 3.36x + 2.36) dx
1.07 1
1
Z 2
= (x5 − 3.36x3 + 2.36x2 ) dx
1.07 1
2
x6 3.36x4 2.36x3

1
= − +
1.07 6 4 3 1
 6
2.36 × 23
  6
2.36 × 13

1 2 4 1
= − 0.84 × 2 + − − 0.84 × 14 +
1.07 6 3 6 3
1 
E(X 2 )

= 3.52 − 0.113 ≈ 3.183800623
1.07

q √
D(X) = 3.183800623 − (1.775700935)2 = 0.030686813 ≈ 0.175176522

20. f (x) = c [ln(x) − 2x + 10], x ∈ ]0, 1]


a)
Z 1
c [ln(x) − 2x + 10] dx = 1 ∴
0
1
2x2

c xln(x) − x − + 10x ∴
2 0
c (1ln(1) − 1 − 12 + 10 × 1) − (0ln(0) − 0 − 02 + 10 × 0) = 1
 

1
8c = 1 ∴ c = ∴ c = 0.125
8

b)
Z x1
F (x) = P r(X < x) = [ln(t) − 2t + 10] dt
08
x
2t2
 
1
= tln(t) − t − + 10t
8 2 0
1
F (x) = [x(9 + ln(x) − x)]
8

Page 133
DRAFT VERSION
c)

P r(X > 0.2) = 1 − P r(X < 0.2)


= 1 − F (0.2)
1
= 1 − [0.2(9 + ln(0.2) − 0.2)]
8
1
= 1 − × 1.438112418
8
= 1 − 0.179764052
≈ 0.820235947

d)

1
Z 1
E(X) = x [ln(x) − 2x + 10] dx
8 0
1
Z 1
xln(x) − 2x2 + 10x dx

=
8 0
1
2x3 10x2
 
1 1 2 1
= x ln(x) − x2 − +
8 2 4 3 2 0
12 2 × 13 10 × 12
 
1 1
= × 12 × ln(1) − − +
8 2 4 3 2
1 49
= ×
8 12
49
E(X) = = 0.510416
96

1
Z 1
E(X 2 ) = x2 [ln(x) − 2x + 10] dx
8 0
1
Z 1
x2 ln(x) − 2x3 + 10x2 dx

=
8 0
1
2x4 10x3
 
1 1 3 1
= x ln(x) − x3 − +
8 3 9 4 3 0
13 14 10 × 13
 
1 1 × ln(1)
= − − +
8 3 9 2 3
1 49
= ×
8 18
49
E(X 2 ) = = 0.34027
144

s  2 r
49 49 245
D(X) = − = ≈ 0.282405035
144 96 3072

21. X ∼ χ212

a) P r(X > 4.40) = 0.975


b) P r(X < 4.40) = 1 − 0.975 = 0.025
c) P r(X > 5.23) < P r(X > 5.00) < P r(X > 4.40) ∴ 0.950 < P r(X > 5) < 0.975
d) 1 − P r(X > 5.23) < P r(X < 10) < 1 − P r(X > 11.34) ∴ 0.025 < P r(X < 10) < 0.500

22. T ∼ t5
a) P r(T > 0.727) = 0.25
b) P r(T < 4.032) = 1 − P r(T > 4.032) = 1 − 0.005 = 0.995
c) t = 2.571
d) P r(X > 5.893) < P r(X > 5.000) < P r(X > 4.773) ∴ 0.0010 < P r(X > 5) < 0.0025
ν→∞
e) tν −→ N (0, 1)

23. F ∼ F (10, 6)

Page 134
DRAFT VERSION
a) P r(F > 2.461) = 0.1
b) f = 4.072

24. X: ‘número de carretas por dia’, X ∼ P(4)


a) Y : ‘tempo (em dias) entre carretas’, Y ∼ E(4)
b) f (y) = 4e−4y
F (y) = 1 − e−4y
1
c) E(Y ) = = 0.25.
4
Espera-serum tempo de 0.25 dia = 6 horas entre as carretas.
1
D(Y ) = = 0.25.
42
O tempo entre carretas varia, em média, 0.25 dia = 6 horas em torno da média.
d) P r(Y < 1) = F (1) = 1 − e−4×1 ≈ 0.981684361.
A probabilidade de que o tempo entre as carretas seja inferior a um dia é de aproximadamente 0.9817.
 
25. a) P r(X > 40) = P r Z > 40−32
√ = P r(Z > 0.94) = 0.1736
72
 
b) P r(20 < X < 40) = P r 20−32
√ < Z < 40−32
√ = P r(−1.41 < Z < 0.94) = 0.7485
72 72
 
18−32
c) P r(X < 18) = P r Z > √ = P r(Z < −1.65) = 0.0495
72

d) x = 32 − 1.26 × 72 ≈ 21.31
e) Pessoas depressivas com até 21.31 anos têm probabilidade 0.1038 de cometer suicı́dio.
 
26. a) P r(X > 43) = P r Z > 43−37
√ = P r(Z > 0.76) = 0.2236
62
 
32−37
b) P r(32 < X < 45) = P r √ < Z < 45−37
√ = P r(−0.64 < Z < 1.02) = 0.5850
62 62

c) x = 37 + 0.31 × 62 = 39.44
d) Pessoas de até 39.44 anos têm probabilidade de pedir financiamento.

a) P r(X < 16) = P r Z < 16−15



27. 2
= P r(Z < 0.50) = 0.6915
13−15

b) P r(X > 13) = P r Z > 2 = P r(Z > −1.00) = 0.8413
c) P r(12 < X < 14) = P r 12−15 Z < 14−15

2
< 2
= P r(−1.50 < Z < −0.50) = 0.2417

28. a) 0.0446 b) 0.6612 c) 0.0005 d) 0.0035 e) 0.9965 f) 278

29. a) Convencional 0.7734, prioritário 0.0478


b) Convencional 0.0401, prioritário 0.0000
c) 0.0474
d) Convencional 28 minutos, prioritário 19 minutos

30. a) 0.3057 b) 673 pessoas c) 6.8744

31. a) 0.2750 b) 0.3931 c) 0.0365

32. B

33. D

34. E

Capı́tulo 4 - Inferência Estatı́stica Clássica


1. Aguardando sugestões.

Exercı́cios extras

1. a) Hipóteses de pesquisa

H0 : o intervalo de tempo entre os ônibus é, em média, igual a 15 minutos
H1 : o intervalo de tempo entre os ônibus é, em média, diferente de 15 minutos

Hipóteses estatı́sticas 
H0 : µ = 15
H1 : µ 6= 15

Page 135
DRAFT VERSION
b) 
H0 : a duração média dos amortecedores é maior ou igual a 100 mil km
H1 : a duração média dos amortecedores é menor que 100 mil km

H0 : µ ≥ 100000
H1 : µ < 100000
c) 
H0 : o ganho médio diário com a nova composiação é de pelo menos 3 litros de leite
H1 : o ganho médio diário com a nova composiação é inferior a 3 litros de leite

H0 : µ ≥ 3
H1 : µ < 3
d) 
H0 : as garrafas de cerveja contêm pelo menos 600mL, em média
H1 : as garrafas de cerveja contêm menos de 600mL, em média

H0 : µ ≥ 600
H1 : µ < 600
e) 
H0 : a face 1 ocorre com frequência equivalente às demais faces
H1 : a face 1 ocorre com frequência diferente das demais faces
 1
H0 : π = 6
1
H1 : π 6= 6

f) 
H0 : a vacina previne pelo menos 80% dos casos de doença
H1 : a vacina previne menos de 80% dos casos de doença

H0 : π ≥ 80%
H1 : π < 80%

2. a) 
H0 : a média é igual a 20
H1 : a média é diferente de 20

H0 : µ = 20
H1 : µ 6= 20
17.4−20
b) zcalc = √ = −2.17 Região crı́tica bilateral a 1%: (−∞, −2.58)∪(2.58, +∞). Não rejeita H0 . Região crı́tica
12/ 100
bilateral a 5%: (−∞, −1.96)∪(1.96, +∞). Rejeita H0 . Região crı́tica bilateral a 10%: (−∞, −1.64)∪(1.64, +∞).
Rejeita H0 .
c) IC(µ, 95%) = 17.4 ± 1.96 × √12 = [15.05, 19.75]
100
3. a) Hipótese de pesquisa

H0 : a pressão diastólica média de mulheres com diabetes é igual a 74.4 mmHg
H1 : a pressão diastólica média de mulheres com diabetes é diferente de 74.4 mmHg

Hipótese estatı́stica 
H0 : µ = 74.4
H1 : µ 6= 74.4
84−74.4
b) tcalc = √ = 3.34
9.1/ 10
Região crı́tica bilateral 5%: (−∞, −2.262) ∪ (2.262, +∞).
valor − p = 2 × P r(T > 3.34) = 2 × 0.0043300861 ≈ 0.0087
DE: Rejeita H0 .
CE: há evidências de que a pressão distólica é maior nas mulheres diabéticas do que em mulheres saudáveis.
c) Sim, pois p = 0.0087 < 0.01.
9.1
d) IC(µ, 90%) = 84 ± 1.833 × √ = [78.73, 89.27]
10
9.1
IC(µ, 95%) = 84 ± 2.262 × √ = [77.49, 90.51]
10
Aumentar a confiança implica em aumentar a amplitude do intervalo.
4. a) Hipótese de pesquisa 
H0 : a média de pontuação não se modificou
H1 : a média de pontuação se modificou
Hipótese estatı́stica 
H0 : µ = 900
H1 : µ 6= 900

Page 136
DRAFT VERSION
b) IC(µ, 95%) = 935 ± 1.96 √180 = [910.05, 959.95]. Acredita-se, com 95% de confiança, que a média das notas
200
esteja entre 910.05 e 959.95.
c) Decisão a partir do intervalo: rejeita-se H0 .
d) A probabilidade de erro do tipo I (rejeitar uma hipótese verdadeira) é p = 0.0060.
5. IC(π, 95%) = [0.7516, 0.9380], onde π é a verdadeira proporção de hotéis ocupados. A informação da rádio pode
estar correta.
6. Se considerarmos que os prédios são estratos em relação à maneira de se vestir, a Amostragem Estratificada seria
uma boa opção.
7. a) µ̂ = x̄ = 3.2, σ̂ = s = 0.4.
b) tcalc = 3.2−3√ = 2.5 > tcritico = 1.711.
0.4/ 25
DE: Rejeita-se H0 com nı́vel de significância de 5%.
CE: O teste sugere que os digitadores cometem mais de 3 erros por página.
c) 3.2 × 150 = 480
23
8. a) π̂ = p = 41
= 0.5610
23
b) 57 × = 32
41
c) IC(π, 85%) = [0.4694, 0.6726]
35
9. a) µ̂ = x̄ = 20
= 1.75
b) IC(µ, 90%) = 1.75 ± 1.64 √2 = [1.0166, 2.4834]
20
10. a) IC(πA , 95%) = [0.4064, 0.4936]
b) IC(πB , 95%) = [0.3277, 0.4123]
31
11. a) π̂ = p = 40
= 0.775
b) IC(π, 95%) = [0.6456, 0.9044]
12. a) H1 : a fábrica embala os produtos com conteúdo médio menor que 500g, conforme anunciado. H1 : µ < 500.
492−500
b) zcalc = √ = −1.33 > zcritico = −1.64. Não rejeita H0 .
30/ 25

13. a) Hipótese de pesquisa



H0 : o rendimento médio dos carros é de 10.4 km/L
H1 : o rendimento médio dos carros é diferente de 10.4 km/L

Hipótese estatı́stica 
H0 : µ = 10.4
H1 : µ 6= 10.4
9.8−10.4
b) tcalc = √ ≈ −1.304 ∈ (−2.064, +2.064). Aceita H0 .
2.3/ 25

14. a) µ̂ = x̄ = 13.71, σ̂ 2 = s2 = 3.552 = 12.6025


b) IC(µ, 98%) = [11.8042, 15.6158]
10
15. a) π̂ = p = 85
= 0.1176
b) IC(π, 91%) = [0.0584, 0.1769]
82
16. a) π̂ = p = 100
= 0.82
b) IC(π, 95%) = 0.82 ∓ 0.0753 = [0.7447, 0.8953]
17. a) µ̂ = x̄ = 13, 000, 000 = 13M M
b) IC(µ, 90%) = 13M M ∓ 1.4M M = [11.6M M, 14.4M M ]
18. IC(µ, 95%) = [0.4289, 0.62110]
19. a) 96.76%
b) |1.88|
20. IC(π, 84%) = [0.4577, 0.4823]

Capı́tulo 5 - Modelos Lineares


Exercı́cios extras
q
8−2
1. a) T = 0.9586 1−0.9586 2 = 8.246 > tcrı́tico = 2.447, p = 0.0002, rejeita-se H0 . O grau de associação linear entre a

metragem quadrada e o preço é 0.9586.


b) Para cada aumento de 1 m2 no imóvel espera-se um aumento de R$ 2192.04 no preço do imóvel.
c) ŷ = 2192.04 × 55 − 14401.57 = 106, 160.63. O preço parece estar bem acima do mercado.

Page 137
DRAFT VERSION
q
18−2
2. a) T = −0.837 1−(−0.837)2
= −6.118 < tcrı́tico = −2.120, p = 0.0000, rejeita-se H0 . O grau de associação linear
entre a idade e a massa corporal é −0.837.
b) ŷ = −1.027 × 60 + 148.218 = 86.60kg.
c) Para cada aumento de 1 ano de idade, espera-se uma redução de −1.027 unidade na massa corporal.
3. a) r = 0.9063, gl = 10 − 2 = 8, t = 6.065 > tcrı́tico = 2.306, p = 0.0003. Rejeita-se H0 : ρ = 0.

b) r = 0.8213 = 0.9063.
c) Em ambos os modelos P r(> |t|) < 0.01 para todos os coeficientes estimados. Em relação aos coeficientes de
determinação, r12 = 0.8213 < 0.9592 = r22 . Em relação aos resı́duos, os do modelo com intercepto está mais
bem ajustado à distribuição normal. À luz destas informações, escolho o modelo com intercepto, na forma
ŷ = 2.8812 + 0.6470x.
d) Eles fornecem a mesma estatı́stica de teste t = 6.065, indicando ser equivalente testar H0 : ρ = 0 e H0 : β1 = 0
no modelo com intercepto.
e) p̂2 = 2.8812 + 0.6470 × 5.6 = 6.5

4. a) r = 0.9110 = 0.9544, gl = 9 − 2 = 7, t = 8.462, P r< |t| = 6.357 × 10−05 < 0.05. Rejeita-se H0 : ρ = 0.
b) Em ambos os modelos P r(> |t|) < 0.05 para todos os coeficientes estimados. Em relação aos coeficientes de
determinação, r12 = 0.9110 < 0.9855 = r22 . Em relação aos resı́duos, os do modelo com intercepto está mais
bem ajustado à distribuição normal. À luz destas informações, escolho o modelo com intercepto, na forma
ŷ = −141.563 + 14.378x.
c) Eles fornecem a mesma estatı́stica de teste t = 8.462, indicando ser equivalente testar H0 : ρ = 0 e H0 : β1 = 0
no modelo com intercepto.
d) ŷ = −141.563 + 14.378 × 22 = 175.006 ≈ 175 picolés.
e) x̂ = 340+141.563
14.378
≈ 33.5 graus Celsius.
5. a) Pela equivalência entre o teste de β1 do modelo completo e o teste para ρ, sabe-se que o p-value é igual a
0.001490 < 0.05. Logo, rejeita-se H0 : ρ = 0.
b) Escolho o modelo completo pois i) todos os coeficientes são significantes, ou seja, p-values menores que 0.05 para
os testes H0 : β0 = 0 e H0 : β1 = 0, ii) seu qq-plot sugere um bom ajuste dos resı́duos à distribuição normal, iii)
o r2 = 0.8879 e iv) o coeficiente β̂1 = −1296 é negativo, coerente com o comportamento dos dados observados.
c) Para cada milı́metro adicional de chuva, espera-se uma redução de 1296 pessoas presentes no evento.
d) ŷ = 20432 − 1296 × 12 = 4880.
6. a) Pela equivalência entre o teste de β1 do modelo completo e o teste para ρ, sabe-se que o p-value é igual a
7.85 × 10−6 < 0.05. Logo, rejeita-se H0 : ρ = 0.
b) Escolho o modelo incompleto pois i) o coeficiente β̂1 é significante, ou seja, seu p-value é 2.05 × 10−11 < 0.05 para
o teste H0 : β1 = 0. O mesmo não ocorre no modelo completo, onde aceita-se H0 : β0 = 0 (p-value 0.145 > 0.05),
sugerindo o modelo incompleto, ii) seu qq-plot sugere um bom ajuste dos resı́duos à distribuição normal e iii)
r2 = 0.9943.
c) Para cada aumento de 1 hora de estudo mensal, espera-se um aumento de 0.42983 pontos na nota média de certa
disciplina.
d) ŷ = 0.42983 × 15 ≈ 6.45.

Capı́tulo 6 - Números Índices


Seção 6.1

1. Aguardando sugestões.

Exercı́cios extras

1. a) pcereja
2007,2009 = 137.11%
Q
b) I2007,2008 = 111.54%
cereja
c) v2007,2009 = 274.23%
Q
d) F2007,2008 = 102.88%
2. a) pmumu
2008,2009 = 155.47%
Q
b) I2007,2008 = 130.00%
P
c) P2009,2010 = 118.00%
P
d) F2009,2010 = 118.00%

Page 138
DRAFT VERSION
C Uma breve introdução ao R e RStudio
R é uma linguagem e ambiente de programação para cálculos estatı́sticos e visualização. Foi desenvolvido
no departamento de Estatı́stica da Universidade de Auckland, e seu código está disponı́vel sob a licença
GNU86 GPL87 . Atualmente a R Foundation está sediada na Universidade de Economia e Negócios de
Viena, Áustria. Foi influenciado por linguagens como S e Scheme seguindo o conceito minimalista
orientado a objeto, que especifica um pequeno núcleo padrão acompanhado de pacotes para a extensão
da linguagem.
RStudio é um ambiente de desenvolvimento integrado ao R. Possibilita a criação de apresentações e
relatórios automáticos em pdf, mesclando as linguagens R e LATEX. Está disponı́vel nas edições Desktop
e Server, reunindo as funcionalidades do R de forma parcimoniosa.

Instalando e acessando R e RStudio


Para instalar o R88 , acesse [Link] e escolha o seu sistema operacional. No Linux, siga as
instruções de instalação via terminal de acordo com a sua distribuição; no Mac OS X, use a extensão
pkg; no Windows, acesse [Link]

Figura C.1: Página de download do R para diferentes sistemas operacionais.

Para instalar o RStudio89 , acesse [Link]/products/rstudio/download e escolha o insta-


lador90 de acordo com seu sistema operacional conforme Figura C.2.

Figura C.2: Página de download do RStudio para diferentes sistemas operacionais.

Caso você não tenha disponibilidade para realizar as instalações sugeridas, pode-se ainda acessar o
R remotamente através de alguns sites.
• [Link]/Rweb/
• [Link]/#/
• [Link] (No botão inferior esquerdo, altere de ‘Java’ para ‘R’)
86 GNU is Not Unix.
87 A Licença Pública Geral GNU é um tipo de licença utilizada para software livre, que garante aos usuários finais
(indivı́duos, organizações ou empresas) a liberdade de usar, estudar, compartilhar e modificar o software.
88 [Link]
89 [Link]
90 Para a versão beta, acesse [Link]

Page 139
DRAFT VERSION
A primeira sessão de R/RStudio
Considera-se que o leitor acessou com sucesso o R/RStudio, conforme detalhamento anterior. Abra o
R/RStudio e crie um novo script através do menu File ; New File ; R Script. Salve este documento
com o nome teste.R em uma pasta apropriada. Este script é um documento de texto onde será escrito o
código R. Note que o RStudio utiliza cores para destacar os diferentes objetos (números, texto, funções),
auxiliando a visualização do código. Para rodar o código que está escrito no documento criado, clique na
linha ou selecione o bloco desejado e tecle Command+Enter (Mac) ou Ctrl+Enter (Windows e Linux).
O R funciona como uma calculadora. Experimente realizar algumas operações simples para começar.
Linhas de código são desconsideradas a partir do sı́mbolo #, que indica um comentário.

> 2+4*3 # Operaç~


oes algébricas básicas, mantendo as propriedades matemáticas

[1] 14

> (2+4)*3 # Note a nova prioridade obtida com os par^


enteses

[1] 18

> 2^3 # Pot^


encias s~
ao indicadas por ^ ou ** (Após digitar ^ d^
e um espaço no teclado)

[1] 8

> 1:10 # O sı́mbolo : indica uma sequ^


encia, que pode ser crescente...

[1] 1 2 3 4 5 6 7 8 9 10

> 10:1 # ... ou decresecente

[1] 10 9 8 7 6 5 4 3 2 1

> -(10:1) # Note a diferença do negativo com

[1] -10 -9 -8 -7 -6 -5 -4 -3 -2 -1

> -10:1 # ... e sem par^


enteses

[1] -10 -9 -8 -7 -6 -5 -4 -3 -2 -1 0 1

> x <- 2 # O sı́mbolo <- (seta para esquerda) indica uma atribuiç~
ao
> x # Digitar o objeto criado apresenta seu conteúdo

[1] 2

> (y = 4) # Apresenta o resultado quando colocado entre par^


enteses

[1] 4

> # = é similar a <-, porém menos versátil. Prefira seta, pois funciona sempre
> (3 -> z) # A atribuiç~
ao com seta pode, ainda, ser feita no sentido oposto

[1] 3

> x+y*z # Pode-se operar com os valores atribuı́dos

[1] 14

Page 140
DRAFT VERSION
> (v <- c(2,0,1,2,4,2)) # Um vetor é facilmente criado com 'c' (concatenar)

[1] 2 0 1 2 4 2

> 2*v # Operaç~


oes s~
ao facilmente realizadas com vetores

[1] 4 0 2 4 8 4

> v^2 # Cada valor ao quadrado. Compare 'sum(v^2)' e '(sum(v))^2'

[1] 4 0 1 4 16 4

> v[3] ao do vetor 'v'


# Apresenta a terceira posiç~

[1] 1

> v[-3] # Apresenta o vetor 'v', exceto a terceira posiç~


ao

[1] 2 0 2 4 2

> v[c(3,5)] oes do vetor 'v'


# Apresenta a terceira e quinta posiç~

[1] 1 4

> length(v) # Indica o tamanho do vetor 'v', teste ?length

[1] 6

> MASS::fractions(cos(c(0,30,45,60)*pi/180)) # Fraç~


oes

[1] 1 226974/262087 2378/3363 1/2

> letters[1:20] # letras minúsculas

[1] "a" "b" "c" "d" "e" "f" "g" "h" "i" "j" "k" "l" "m" "n" "o" "p" "q" "r" "s" "t"

> noquote(LETTERS) # letras maiúsculas sem aspas

[1] A B C D E F G H I J K L M N O P Q R S T U V W X Y Z

> substr('abcdef', 2, 4) # apresenta da segunda até a quarta posiç~


ao

[1] "bcd"

> x <- c('Chimarrao', 'Gaita', 'Bah')


> strsplit(x, 'a') # retira a letra 'a'

[[1]]
[1] "Chim" "rr" "o"

[[2]]
[1] "G" "it"

[[3]]
[1] "B" "h"

> tolower(x) # minúsculas

[1] "chimarrao" "gaita" "bah"

> toupper(x) # maiúsculas

[1] "CHIMARRAO" "GAITA" "BAH"

Page 141
DRAFT VERSION
D Equação da Reta
A equação da reta é uma relação matemática utilizada para descrever uma reta no plano cartesiano 91 .
Pode ser apresentada de formas distintas, sendo que na Seção 5.2 é utilizada a notação da reta reduzida,
fazendo a0 = β1 e b0 = β0 .

Tipo Equação
Geral ax + by + c = 0
x y
Segmentária + =1
−c/a −c/b
a c
Reduzida y = − x − ⇒ y = a0 x + b0
b b

Exemplo D.1. (Equação reduzida) Considere a reta que passa pelos pontos A = (0, −3) e B = (1.5, 0).

Uma maneira de descobrir a equação reduzida é substituir os pontos A e B em y = a0 x + b0 :

Ponto A −3 = a0 × 0 + b0 ⇒ b0 = −3
3
Ponto B + b0 0 = a0 × 1.5 + (−3) ⇒ a0 = =2
1.5

Assim, a equação reduzida da reta é y = 2x − 3, onde o coeficiente angular é a0 = 2 e o intercepto


(constante ou coeficiente linear) é b0 = −3. Para cada aumento de 1 unidade em x, y aumenta 2 unidades.
,
Exemplo D.2. (Equação segmentária) Do Exemplo D.1, pode-se obter a equação segmentária da reta
a partir da forma reduzida.
2 1 3 x y x y
y = 2x − 3 ⇔ 2x − y = 3 ⇔ x− y = ⇔ + =1 ⇔ + = 1.
3 3 3 3/2 3/ − 1 1.5 −3

Assim, −c/a = 1.5 e −c/b = −3. Note que xB = 1.5 e yA = −3.


,
Exemplo D.3. (Equação geral) Do Exemplo D.1, pode-se obter a equação geral da reta a partir da
forma reduzida.
y = 2x − 3 ⇔ 2x − y − 3 = 0.
2 −3
Assim, a = 2, b = −1 e c = −3. Note que a0 = − = 2 e b0 = − = −3.
−1 −1
,
91 Sistema de coordenadas formado por duas retas reais perpendiculares – i.e., que formam um ângulo de 90o – utilizado
para especificar pontos a partir de um par de coordenadas numéricas na forma (x, y).

Page 142
DRAFT VERSION
Referências
Anderson, D., Sweeney, D., Williams, T., and de Castro Paiva, L. (2007). Estatı́stica aplicada à Admi-
nistração e Economia. Cengage Learning.
Anscombe, F. (1973). Graphs in statistical analysis. The American Statistician, 27(1):17–21.

Baratojo, J. (2000). Fatos, contos e piadas da sala de aula (pp. 56–57).


Beers, M. and Fletcher, A. (2004). Manual Merck de Informação Médica: Saúde para a famı́lia segunda
edição. Merck Manual os Medical Information Home Edition. Simon & Schuster.
Bernardo, J. M. and Smith, A. F. (2009). Bayesian Theory, volume 405. John Wiley & Sons.

Berthouex, P. and Brown, L. (2002). Statistics for environmental engineers. CRC.


Blackwell, D., Pereira, C., and Borges, W. (1974). Estatı́stica Básica. McGraw-Hill do Brasil.
Bolfarine, H., de Oliveira Bussab, W., and de Estatı́stica, A. B. (2005). Elementos de amostragem.
Edgard Blücher.

Breslow, N. E. and Day, N. E. (1980). Statistical Methods in Cancer Research. Volume 1—The Analysis
of Case-Control Studies. IARC Scientific Publications, Lyon, France.
Breslow, N. E. and Day, N. E. (1987). Statistical Methods in Cancer Research. Volume 2—The Design
and Analysis of Cohort Studies. IARC Scientific Publications, Lyon, France.

Callegari-Jacques, S. (2003). Bioestatı́stica. Princı́pios e Aplicações. Porto Alegre, ArtMed.


Chow, S.-C., Shao, J., and Wang, H. (2007). Sample size calculations in clinical research, volume 20.
Chapman & Hall/CRC.
de Finetti, B. (1974). Theory of Probability. John Wiley & Sons, Inc., Chichester, first edition.

DeGroot, M. and Schervish, M. (2002). Probabilty and Statistics. Addison Wesley, Boston, MA, Pennsyl-
vania.
Diewert, W. and Nakamura, A. (1993). Essays in index number theory. North-Holland.
Dukette, D. and Cornish, D. (2009). The essential 20: Twenty components of an excellent health care
team (pp. 72–73).

Eisenhauer, J. (2003). Regression through the origin. Teaching Statistics, 25(3):76–80.


Feller, W. (1968). An Introduction to Probabilty Theory and Its Applications. John Wiley & Sons, Inc.,
New York, third edition.
Gelman, A., Carlin, J. B., Stern, H. S., and Rubin, D. B. (2003). Bayesian data analysis. Chapman &
Hall/CRC.
Hohenwarter, M., Borcherds, M., and Ancsin, E. (2014). GeoGebra [Link]-3d. [Link]
org.
Huff, D. and Geis, I. (1954). How to lie with statistics.

Hyndman, R. J. and Khandakar, Y. (2008). Automatic time series forecasting: the forecast package for
R. Journal of Statistical Software, 26(3):1–22.
Iezzi, G. and Murakami, C. (1977). Fundamentos de Matemática Elementar 1: Conjuntos, funções. SP
Editora Atual.

Ioannidis, J. P. (2005). Why most published research findings are false. PLoS medicine, 2(8):e124.
James, B. (2010). Probabilidade: Um curso em nı́vel intermediário, coleção euclides. Rio de Janeiro.
IMPA, 3ª Edição.

Page 143
DRAFT VERSION
Koertge, N. (2008). New dictionary of scientific biography. Charles Scribner’s Sons/Thomson Gale
Detroit, MI.
Kotz, S., Read, C., Balakrishnan, N., and Vidakovic, B. (2005). Encyclopedia of statistical sciences, 16
volume set.
Leisch, F. (2002). Sweave: Dynamic generation of statistical reports using literate data analysis. In
Härdle, W. and Rönz, B., editors, Compstat 2002 — Proceedings in Computational Statistics, pages
575–580. Physica Verlag, Heidelberg. ISBN 3-7908-1517-9.
Likert, R. (1932). A technique for the measurement of attitudes. Archives of psychology.
McCullagh, P. and Nelder, J. A. (1989). Generalized linear models (monographs on statistics and applied
probability 37). Chapman Hall, London.
Meyer, D., Dimitriadou, E., Hornik, K., Weingessel, A., and Leisch, F. (2017). e1071: Misc Functions
of the Department of Statistics, Probability Theory Group (Formerly: E1071), TU Wien. R package
version 1.6-8.
Meyerhof Salama, B. (2011). Dano moral no brasil. Série Pensando o Direito, (37).
Morettin, P. and Bussab, W. (2008). Estatı́stica básica. Saraiva.
Mullard, A. (2011). Reliability of ‘new drug target’ claims called into question. Nature Reviews Drug
Discovery, 10(9):643–644.
Pagano, M. (2004). Princı́pios de bioestatı́stica. Pioneira Thomson Learning.
Paulino, C., Turkman, M., and Murteira, B. (2003). Estatı́stica Bayesiana. Fundação Calouste Gulben-
kian, Lisboa.
Pfanzagl, J. and Sheynin, O. (1996). Studies in the history of probability and statistics xliv - a forerunner
of the t-distribution. Biometrika, pages 891–898.
Püschel, F. (2010). Dano moral. Projeto Pensando o Direito, (37).
R Core Team (2017). R: A Language and Environment for Statistical Computing. R Foundation for
Statistical Computing, Vienna, Austria.
Salkind, N. (2007). Encyclopedia of measurement and statistics. Sage Publications, Inc., Thousand Oaks.
Scheinerman, E. (2003). Matemática Discreta - Uma Introdução. Thomson.
Scrucca, L. (2004). qcc: an r package for quality control charting and statistical process control. R News,
4/1:11–17.
Silver, N. (2012). The Signal and the Noise: Why So Many Predictions Fail-but Some Don’t. Penguin
Press.
Stokes, M. (1997). Plato: Apology of Socrates. Aris & Phillips.
Sturges, H. A. (1926). The choice of a class interval. Journal of the American Statistical Association,
21(153):65–66.
Triola, M. (1999). Introdução à estatistica. 7ª edição. Rio de Janeiro: Livros Técnicos e Cientı́ficos
Editora.
Tufte, E. (2007). The Visual Display of Quantitative Information. Graphics Press LLC.
Weisberg, S. (2005). Applied linear regression, volume 528. John Wiley & Sons.
Wickham, H. (2009). ggplot2: Elegant Graphics for Data Analysis. Springer-Verlag New York.
Yule, G. and Kendall, M. (1948). Introdução à Teoria da Estatı́stica. Instituto Brasileiro de Geografia e
Estatı́stica.

Page 144
DRAFT VERSION

Page 145

Você também pode gostar