0% acharam este documento útil (0 voto)
5 visualizações56 páginas

Medidas de Tendência Central e Variabilidade

A aula aborda Estatística Descritiva, focando em Medidas de Tendência Central como média, mediana e moda. A média é calculada considerando todos os valores, enquanto a mediana divide a amostra ao meio e é menos afetada por valores extremos. A moda identifica os valores mais frequentes, e a escolha entre essas medidas depende da distribuição dos dados.

Enviado por

CleberCarmo
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
5 visualizações56 páginas

Medidas de Tendência Central e Variabilidade

A aula aborda Estatística Descritiva, focando em Medidas de Tendência Central como média, mediana e moda. A média é calculada considerando todos os valores, enquanto a mediana divide a amostra ao meio e é menos afetada por valores extremos. A moda identifica os valores mais frequentes, e a escolha entre essas medidas depende da distribuição dos dados.

Enviado por

CleberCarmo
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

Aula 2

 Estatística Descritiva (Medidas Sumárias)

Prof. Cosme Marcelo Furtado Passos da Silva


Profa. Taynãna César Simões
1
Medidas de Tendência Central

Caracterizam o conjunto de dados por valores


que representem todos os outros valores da amostra.

É uma forma de resumir o conjunto de dados


em um único valor.

• Média

• Mediana

• Moda 2
Média (Média Aritmética)

• Leva em conta todos os n elementos da amostra;

• Somam-se todos os n valores da amostra e divide-se

pela quantidade total de valores n da amostra;

•OBS: O valor da média não necessariamente pertence

ao conjunto original de valores.


3
Média (Média Aritmética)

Exemplo:

Seja x uma variável utilizada para representar

os valores observados do Volume Expiratório Forçado

FEV1 (volume de ar que pode ser expelido do pulmão

depois de um segundo de esforço constante).

4
Média Aritmética

x1 = 2,30
x2 = 2,15
x3 = 3,50
x1  x 2  x 3   x13 38,35
x4 = 2,60 x  
x5 = 2,75 13 13
x6 = 2,82  2,95 litros.
x7 = 4,05
x8 = 2,25
x9 = 2,68
x10 = 3,00
x11 = 4,02
x12 = 2,85
x13 = 3,38 5
Média Aritmética

Sejam n valores de x (x1, x2, ..., xn), a média

aritmética é expressa por:

 x i
x1  x  ...  x
x  i1
 2 n
n n

6
Média Aritmética
Tabela de Frequência
X fi
X fi Xfi
x1 f1
x1 f1 x 1f 1
x2 f2
x2 f2 x 2 f2
.
.
.
.
xk fk
xk fk xkfk

Total n Total n
k k

 xi fi  xi fi
x  i1
 i1
k
n
fi
i 1 7
Média Aritmética
Tabela de Frequência

k k

 xi fi  xi fi
x  i1
 i1
k
n

i
fi
1

8
Média Aritmética
Tabela de Frequência

Exemplo
No. de filhos
X fi
0 4
1 5
2 7
3 3
5 1
Total 20
9
Média Aritmética
Tabela de Frequência

Exemplo
k k
No. de filhos
X fi Xfi
 xi fi  xi fi
x  i1
 i1

0 4 0
k
n
fi
i 1
1 5 5
2 7 14 33
x   1,65
3 3 9 20
5 1 5
Total 20 33
10
Média para Dados Agrupados

 Em algumas situações temos


apenas os dados agrupados em Nível de Colesterol (mg/100ml) fNi
uma distribuição de
80-119 13
frequências.
120-159 150
160-199 442
 Ex: Distribuição de níveis
séricos de colesterol para 200-239 229
homens dos EUA, com idade 240-279 115
entre 24 e 34 anos, 1976- 280-319 34
1980. 320-359 9
 A média é obtida assumindo 360-399 5
que os valores em cada Total 1067
intervalo são iguais ao seu
ponto médio -> aproximação...
11
Média para Dados Agrupados

 Para encontrarmos a
média dos dados Nível de fi Ponto
agrupados, multiplicamos
colesterol médio (mi)

o ponto médio (mi) de cada 80-119 13 99,5


intervalo pela frequência 120-159 150 139,5
correspondente. Somamos 160-199 442 179,5
esses valores e dividimos 200-239 299 219,5
pelo total do número de 240-279 115 259,5
observações k 280-319 34 299,5
m f i i 320-359 9 339,5
x i 1
k
360-399 5 379,5

f
i 1
i
TOTAL 1067
12
Média para Dados Agrupados

Nível de fi Ponto médio


colesterol
80-119 13 99,5
k

m f
120-159 150 139,5
160-199 442 179,5 i i
200-239 299 219,5 x i 1
k
240-279
280-319
115
34
259,5
299,5 f i 1
i
320-359 9 339,5
360-399 5 379,5
TOTAL 1067

 1 
x  (99,5x13)  (139,5x150 )  (179,5x442 )  (219,5x299 )  ...  198,84
 1067 
13
Média - Robustez

A média aritmética não é uma medida robusta,


pois é influenciada por valores extremos.

Tomando o primeiro exemplo, imagine que o valor


4,02 tenha sido digitado como 40,2:

2.3, 2.15, 3.50, 2.60, 2.75, 2.82,


4.05, 2.25, 2.68, 3.00, 40.2, 2.85

14
Média - Robustez

Média anterior=2,95 litros (x1 )

Média atual=5,73 litros (x 2 )

x2  2x1

15
Mediana

A mediana é o valor da distribuição que divide a


distribuição ao meio.

50% das observações ficam acima da mediana e 50%


ficam abaixo.

A mediana é uma medida mais robusta, pois é menos


sensível a valores atípicos.

16
Mediana

Para se calcular a mediana é preciso ordenar os


valores. Seja n o tamanho da amostra.
A posição da mediana é dada pelo elemento de ordem:
(n+1)/2 se n for ímpar:
x1 x2 x3 (3+1)/2= 2, ou seja, elemento de ordem 2: x2

Se n for par, o valor da mediana é dado pela média


dos elementos de ordem n/2 e (n+2)/2:
x1 x2 x3 x4 x  x
md  2 3

2
17
Mediana

Como ilustração, considere os valores ordenados de


dois conjuntos de dados :
(1)

1 2 5 6 7

No primeiro conjunto n é ímpar (n = 5). Logo, a


mediana é dada pelo valor que ocupa a terceira
posição (5+1)/2, que é igual a 5.
18
Mediana

No segundo conjunto (n = 6) o valor mediano é dado


pela média aritmética dos valores que ocupam as
posições (n/2) e (n+2)/2, ou seja, posições 3 e 4:
(2)
1, 2, 5, 6, 7, 7

Logo, a mediana (md) é:


56
md   5,5
2
19
Mediana - Robustez

(1)

2.15, 2.25, 2.30, 2.60, 2.68, 2.75,


2.82, 2.85, 3.00, 3.38, 4.02, 4.05
(2)

2.15, 2.25, 2.30, 2.60, 2.68, 2.75,


2.82, 2.85, 3.00, 3.38, 4.05, 40.2

2,75  2,82 5,57 Não se alterou com o


md1  md 2    2,785
2 2 valor atípico
20
Moda

• Valores que mais aparecem na amostra (mais


frequentes).

• A moda sempre pertence ao conjunto original de


valores.

Unimodal
moda = 5

21
Moda

Bimodal
modas = 2 e 6

Amodal

22
Moda

Valores que ocorrem mais frequentemente.

23
Qual medida escolher???
Mediana versus Média

24
Qual medida escolher???
Mediana versus Média

Média

• Medida mais usada na prática;

• Facilidade de tratamento estatístico (propriedades interessantes);

• Porém, muito influenciada por valores extremos (outliers).

Mediana

• Não é tão influenciada por valores extremos;

• Desvantagem: utiliza no máximo dois valores da amostra.


25
Qual medida escolher???
Mediana versus Média

26
Qual medida escolher???
Moda versus Média e Mediana

Moda é interessante quando as variáveis tratadas têm distribuição de


frequências bimodais ou multimodais.

27
Forma da Distribuição de Frequências e
Medidas de Tendência Central

28
à direita

à esquerda

29
Medidas de Variabilidade

Além da informação do valor representativo do conjunto de valores

da amostra (medidas de tendência central), é importante expressar

a variabilidade desses valores em relação a uma determinada

referência.

• Amplitude Total

• Variância

• Desvio-padrão

• Coeficiente de Variação
30
Medidas de Variabilidade

31
Amplitude Total

Diferença entre o valor máximo e o valor mínimo de um conjunto


de dados.

Exemplo:

32
Amplitude Total

Medida grosseira!!!

33
Medidas de Dispersão

Variância e Desvio-padrão

A variância mede a variabilidade ao redor da média.

 xi  x 
n 2

Var (x )   x  
2
.
i 1 n

34
Variância e Desvio-padrão

Quando estamos trabalhando com amostra, a


variância é dada por:

 xi  x 
n 2

Var (x )  sx  
2
.
i 1 n 1

O desvio-padrão é dado pela raiz quadrada da variância.

35
Desvio-padrão

O desvio-padrão possui a mesma unidade de


medida que os dados originais.
36
Cálculo da Variância

xi  x  xi  x 
2
Indivíduo xi
1 2,30 -0,65 0,4225
2 2,15 -0,80 0,6400
3 3,50 0,55 0,3025
4 2,60 -0,35 0,1225
5 2,75 -0,20 0,0400
6 2,82 -0,13 0,0169
7 4,05 1,10 1,2100
8 2,25 -0,70 0,4900
9 2,68 -0,27 0,0729
10 3,00 0,05 0,0025
11 4,02 1,07 1,1449
12 2,85 -0,10 0,0100
13 3,38 0,43 0,1849
Total 38,35 0 4,6596
37
Variância e Desvio-padrão

13 2
1
s 
2

13  1 i 1
 xi  2,95
4, 6596
  0,39 litros .
2

12

s  0,39 litros  0, 62 litros.


2

38
Variância e Desvio-padrão
Dados agrupados
 Novamente assumimos Nível de fi Ponto
que todas as observações colesterol médio (mi)
de um intervalo são 80-119 13 99,5
iguais ao ponto médio do 120-159 150 139,5
intervalo (mi) 160-199 442 179,5
k 200-239 299 219,5
 i
( m  x ) 2
 fi 240-279 115 259,5
s2  i 1
k
280-319 34 299,5
f
i 1
i 1 320-359 9 339,5
360-399 5 379,5
TOTAL 1067
S = 43,94
39
Variância e Desvio-padrão

40
Quando o s é grande ou pequeno?

Um desvio-padrão de 10 unidades é grande ou pequeno????

1) Se a média é 10.000  desvio é pequeno.

2) Se a média é 100  desvio é grande.

 Magnitude em relação à média.

1) Desvio corresponde a 0,1% da média: 10 / 10.000.

2) Desvio corresponde a 10% da média: 10 / 100.


41
Coeficiente de Variação

Índice relativo de dispersão: expressa a variabilidade sem a


influência da ordem de grandeza da variável.

Desvio  padrão
CV 
Média

• Quanto menor é o coeficiente de variação de um conjunto de


dados, menor é a sua variabilidade. Medida Adimensional.

42
Coeficiente de Variação

43
Regra do Desvio-padrão
(Distribuições Simétricas)

44
Outras Medidas de Posição

Posição de um indivíduo no conjunto de dados: mostrada pelo


percentil, contando-se (em percentagem) quantos indivíduos no
conjunto têm valores menores que deste indivíduo.

• Percentis

45
Percentis

O percentil de ordem k (onde k é qualquer valor entre 0 e


100), denotado por Pk, é o valor tal que k% dos valores do
conjunto de dados são menores ou iguais a ele.

• Percentis: 10, 20, 30, ..., 90  Decis

• Percentil 25  Primeiro quartil (Q1)

• Percentil 50  Segundo quartil (Q2)  Mediana

• Percentil 75  Terceiro quartil (Q3)


46
Percentis

47
Percentis

Conjuntos de peso ao nascer de 20 recém-nascidos

2069, 2581, 2759, 2834, 2838


2841, 3031, 3101, 3200, 3245
3248, 3260, 3265, 3314, 3323
3484, 3541, 3609, 3649, 4146
P10=? 10% abaixo e 90% acima
L=(10/100)x(20)=2;
Como L é inteiro, tiramos a média entre o
elemento L = 2 e L+1 =3

P10=(2581+2759)/2=2670 g Interpretação...
48
Percentis

L=[(90/100)x20]=18; L é inteiro, logo


P90=?
tiramos média entre L=18 e L+1=19;

18o da esquerda para direita – 3609


19o da direita para esquerda - 3649

P90=[(3609+3649)/2]=3629 g Interpretação...

49
Percentis

50
Variáveis Contínuas - Boxplot

• Gráfico que detecta valores discrepantes (outliers);

• Utiliza os quartis: Q1, Q2 e Q3;

• Valores mínimo e máximo do conjunto de dados;

• DIQ = Q3 – Q1
51
Variáveis Contínuas - Boxplot

Limite sup erior  Q3  1,5  DIQ

Limite inf erior  Q1  1,5  DIQ


52
Variáveis Contínuas - Boxplot

53
Variáveis Contínuas - Boxplot

54
Variáveis Contínuas - Boxplot

Contagem de
linfócitos TCD4 em
pacientes em remissão de
doença de Hodgkin e em
remissão de malignidades
disseminadas não Hodgkin.

55
Bibliografia

1) Soares, J F; Siqueira, A L. Introdução à Estatística Médica. Coopmed Editora Médica, 2a


edição, 2002, Belo Horizonte, MG.

2) Magalhães, M. N.; Lima, A. C. P (2005). Noções de Probabilidade e Estatística. 6ª ed. Edusp.


São Paulo.
3) Silva, Nilsa Nunes (2004). Amostragem Probabilística: Um curso introdutório. Edusp. Brasil.
4) Mood, A. M. et al. 1974. Introduction to the Theory of Statistics. 3. ed. Tokyo, McGraw-Hill
Kogakusha.
5) Triola, M.F. Introdução à Estatística. Rio de Janeiro: LTC Editora, 1999
6) Pagano, M., e Gauvreau, K. Princípios de Bioestatística, Segunda Edição São Paulo: Thomson,
2004
7) Venables WN, Ripley, BD (2002). Moderns Applied Statistics with S. Fourth Edition. Springer.
8) Venables WN, Smith DM, et al. (2002). An introduction to R: notes on R: a programming
environment for data. Bristol, Network Theory
9) Dalgaard, P. (2002) Introductory Statistics with R. Springer.

56

Você também pode gostar