Proiect Statistica
Proiect Statistica
2019
1
Cuprins
Cuprins
1. Introducere........................................................................................................................................3
2. Descrierea bazei de date si a variabilelor analizate.........................................................................4
3. Analiza statistica univariata a datelor.............................................................................................7
3.1. Descrierea statistica a variabilelor calitatative...........................................................................7
3.2 Descrierea statistica a variabilelor cantitative................................................................................11
4. Analiza statistica bivariata a variabilelor......................................................................................20
4.1. Analiza statistică a asocierii dintre doua variabile................................................................20
4.2 Analiza de regresie si corelatie................................................................................................22
5. Estimarea si testarea statistica........................................................................................................29
5.1. Estimarea unei medii prin interval de incredere......................................................................29
5.1.1. Estimarea prin interval de încredere a unei medii...........................................................29
5.1.2. Estimarea prin interval de incredere a diferentei dintre doua medii...............................30
5.2. Testarea statistică......................................................................................................................31
5.2.1. Testarea unei medii...........................................................................................................31
5.2.2. Testarea unei proporții.....................................................................................................33
5.2.3. Testarea diferenței dintre două medii și două (sau mai multe) proporții........................34
5.2.4. Testarea asocierii dintre doua variabile...........................................................................36
5.2.5. ANOVA - Testarea diferentelor dintre trei si mai multe medii........................................36
Concluzii:.................................................................................................................................................37
2
1. Introducere
Prin realizarea acestui proiect mi-am propus să analizez baza de date „Employee [Link]”.
Scopul meu este acela de a obseva variația salariului curent al angajaților din firmă în
concordanță cu factorii de influență ce acționează asupra acestuia.
În studiul meu am folosit trei variabile numerice (cantitative) și două variabile nenumerice
(calitative)
Variabilele ce urmează a fi analizate sunt: salary, salbegin,prevexp, gender, qualif_lvl.
3
2. Descrierea bazei de date si a variabilelor analizate
4
În studiul de față am ales spre analiză următoarele variabile:
Variabile numerice:
o „Salary” - Current Salary (Salariul curent)
o „Salbegin” - Beginning Salary (Salariu de început)
o „Prevexp” - Previous Experience (months) (Experiența anterioară exprimată în
luni)
Variabile nenumerice:
o „Gender” (Genul)
o „Qualif_lvl” - Qualification level ( Nivelul de calificare)
Am creat variabila qualif_lvl prin recodificarea variabilei prevexp (scalară) într-o nouă
Pentru a face asceastă operațiune am selesctat din meniul Transform - Recode into Different
Variables.
Următorul pas a fost să atribui semnificații celor trei grupe nou create, astfel încât din modul
6
Tabelul de mai sus a fost obținut astfel: File – Display Data File Information- Working File
Acesta a fost creat pentru a vedea informațiile cu privire la variabilele ce se găsesc în baza
actuală de date.
Statistics
Gender
Valid 474
N
Missing 0
Gender
După cum se poate observa, din totalul populației de 474 persoane (fără valori lipsă) sunt 216
femei, reprezentând un procent de 45.6%. Pe de altă parte, bărbații angajați din firmă sunt în număr de
258 de persoane și semnifică 54.4% din totalul populației.
7
Figure 6 Repartiția persoanelor în funcție de gen
Pentru a ajunge la aceste rezultate am urmat următorii pași: Analyze – Descriprive Statistics –
Frequencies.
8
Figure 8 Alegerea graficului Pie Charts pentru var. Gender
Statistics
qualification level
Valid 474
N
Missing 0
qualification level
Din totalul populației de 474 persoane din firmă, sunt 217 persoane ce au gradul de
calificare începător ( până la 4 ani de experiență), ceea ce înseamnă 45.8% din total. De
asemenea sunt 110 persoane cu experiență medie (între 4 și 9 ani vechime), reprezentând 23.2%
din angajați. Pe de altă parte 69% din totalul angajaților au până la 9 ani de vechime. În cele din
urmă sunt 147 de angajați, cu un procent de 31.0% ce au statutul de avansat, experiența lor în
muncă totalizând peste 9 ani.
9
Figure 9 Repartiția persoanelor în funcție de nivelul de calificare
10
Figure 11Alegerea graficului Pie Charts pentru var. qualif_lvl
Statistics
Previous Experience (months)
Valid 474
N
Missing 0
Mean 95.86
Median 55.00
Mode 0
Std. Deviation 104.586
Variance 10938.281
Skewness 1.510
Std. Error of Skewness .112
Kurtosis 1.696
Std. Error of Kurtosis .224
Minimum 0
Maximum 476
11
25 19.00
Percentiles 50 55.00
75 140.00
Tabel 3 Descrierea variabilei cantitative „Prevexp”
12
Figure 12 Curba frecvențelor cu privire la experiența de muncă anterioară
Pentru a obține graficul și tabelul de mai sus am urmat următorii pași:Analyze- Descriprive
Statistics- Frequencies
Apoi, din submeniul Statistics, am selectat: Quartiles, Mean, Median, Mode, Std.
Deviation, Variance, Minimum, Maximum, Skewness și Kurtosis, indicatori pe care i-am
considerat semnificativi pentru variabila Prevexp.
În ceea ce privește reprezentarea grafică, am ales histograma.
13
Salbegin
Statistics
Beginning Salary
Valid 474
N
Missing 0
Mean $17,016.09
Median $15,000.00
Mode $15,000
Std. Deviation $7,870.638
Variance 61946944.959
Skewness 2.853
Std. Error of Skewness .112
Kurtosis 12.390
Std. Error of Kurtosis .224
Minimum $9,000
Maximum $79,980
25 $12,450.00
Percentiles 50 $15,000.00
75 $17,617.50
Tabel 4 Descrierea variabilei cantitative „Salbegin”
16
Salary
Statistics
Current Salary
Valid 474
N
Missing 0
Mean $34,419.57
Median $28,875.00
Mode $30,750
Std. Deviation $17,075.661
Variance 291578214.453
Skewness 2.125
Std. Error of Skewness .112
Kurtosis 5.378
Std. Error of Kurtosis .224
Minimum $15,750
Maximum $135,000
25 $24,000.00
Percentiles 50 $28,875.00
75 $37,162.50
Tabel 5 Descrierea variabilei cantitative „Salary”
17
Q3: $37,162.50 (75% dintre angajați au până la $37,162.50 salariu curent, iar 25% dintre
angajați au peste $37,162.50 salariu curent).
18
Am selectat indicatorii staatistici potriviți pentru variabila analizată:
19
4. Analiza statistica bivariata a variabilelor
Pentru analiza statistică a asocierii dintre două variabile am ales „Gender” (Genul) și
„Qualif_lvl” Qualification level ( Nivelul de calificare).
Astfel, voi analiza nivelul de calificare al angajaților (începător, mediu, avansat) în funcție de
gen (masculin, feminin). Voi verifica dacă există o asociere semnificativă între calificarea
angajaților în funcție de gen.
Cases
Gender Total
Female Male
avansat 59 88 147
Total 216 258 474
Tabel 6 Analiza statistică a asocierii dintre Gender și Qualif_lvl
Regula de decizie:
Sig< α – se respinge H0
Sig>α – se acceptă H0
20
Chi-Square Tests
Se constată că sig asociat coef Pearson este de 0,00< 0,05 (riscul asumat, α=0,05), se
respinge H0 și se acceptă ipoteza H1, rezultă faptul că cele două variabile sunt asociate.
21
4.2 Analiza de regresie si corelatie
Analiza de regresie studiază legătura statistică între două sau mai multe variabile statistice sub
aspectul formei acesteia.1
Regresia liniară simplă
Ecuația modelului de regresie liniară simplă: Y= β0 + β1 X + εi
Y – variabila dependentă (salary- salariul curent)
X – variabila independentă (salbegin – salariul de încadrare)
ε – variabila reziduală sau eroare
β0 , β1 – parametrii modelului econometric, coeficienți de regresie
Coefficientsa
β0: valoarea salariului curent este 1928.206$ atunci când salariul de încadrare este 0. (nu are sens
interpretarea, deoarece salariul de început nu poate fi 0)
β1 : valoarea salariului curent crește în medie cu 1.909$ atunci când valoarea salariului de
încadrare crește cu 1$.
β1>0 – există o legătură directă între salariul curent și salariul de început
Testarea parametrilor modelului liniar pentru un risc asumat de 0.05
Pentru β0,1 :
H0 : parametrii nu sunt semnificativi statistic
1
Suport curs econometrie 2018-2019
22
Model Summary
Raportul de corelație R= 0.097 ceea ce arata ca legatura dintre cele doua variabile este
slabă.
Raportul de determinație R2=0.009 ceea ce ne arată că 0.9% din variația variabilei
salariului curent este explicata prin variatia salariului de încadrare, iar restul de pana la 100% se
datoreaza factorilor aleatori.
ANOVAa
137916495436. 473
Total
340
Valoarea lui Sig pentru F calculat este de 3,4%<5% , prin urmare relația liniară dintre
cele doua variabile studiate este una semnificativa.
23
Regresia liniară multiplă
Coefficientsa
β0: valoarea medie a salariului curent este de 3850.718$ atunci când valorile salariului de început
cât și ale experienței anterioare sunt egale cu 0.
β1: salariul curent crește în medie cu 1.923$ la o creștere cu 1$ a salariului de încadrare, în
condițiile în care influența experienței anterioare rămâne constantă.
β1>0 – există o legătură directă între salariul curent și salariul de început
β2: salariul curent scade în medie cu 22.445$ atunci când experiența anterioară crește cu o lună,
în condițiile în care influența salariului de încadrare rămâne constantă.
β2<0 - există o legătură inversă între salariul curent și experiența anterioară
Deoarece Sig asociat celor trei variabile este egal cu 0,00 rezultă că pentru un risc asumat de
0,05 cele trei variabile sunt semnificative statistic.
24
Model Summary
ANOVAa
137916495436. 473
Total
340
25
Regresie neliniara – Modelul Growth
Coefficients
Y=e9.635+4.244E-005*X1
26
Model Summary
Raportul de corelatie R=0.841 arata o legatura puternică intre cele doua variabile studiate.
Raportul de determinatie R2=0.707 arată că 70,7% din variația variabilei dependente, salariu
curent este explicată prin variația variabilei salariu de început.
ANOVA
Se observa ca Sig e de 0.00< 0.05 ceea ce arata ca relatia dintre cele doua variabile este
semnificativa.
Pentru a ajunge la aceste rezultate: Analyze- Regression – Curve Estimation (Modelul Growth)
27
Figure 16 Regresie neliniară- Modelul Growth
Analiza de corelatie
Analiza de corelaţie studiază legătura statistică între două sau mai multe variabile statistice sub
aspectul intensităţii acesteia.
Correlations
N 474 474
**
Pearson Correlation .880 1
N 474 474
Coeficientul de corelatie Pearson este egal cu 0.880 si arată că între cele două variabile există o
corelatie directa și puternică.
Valoarea lui Sig. este de 0.00<0.05 si arată că între cele două variabile legătura este
semnificativă.
Pașii urmați pentru a obține aceste rezultate: Analyze-Corelate-Bivariate
28
Figure 17 Analiza de corelație între două variabile
Descriptives
Median $28,875.00
Variance 291578214.453
Minimum $15,750
Maximum $135,000
Range $119,250
29
Case Processing Summary
Cases
5.1.2.
5.1.2.
5.1.2.
5.1.2.
5.1.2.
5.1.2.
5.1.2.
5.1.2.
5.1.2.
5.1.2.
5.1.2.
Figure 18 Estimarea unei medii prin interval de incredere 5.1.2.
E
stimarea prin interval de incredere a diferentei dintre doua medii
30
Group Statistics
Interpretare:
Pentru început ne uităm la nivelul de semnificație observat pentru acest test, care este
mai mic decat α=0.05 (Sig= 0.000), deci se vor folosi variante egale. Din această perspectivă,
testul t este egal cu -10.945, Sig=0< α=0.05. Garantăm cu o probabilitate de 95% că există
diferențe semnificative intre variatiile dintre grupe ($26,031.92 este media salariului curent pe
care îl au femeile, iar bărbații au în medie un salariu de $41,441.78).
31
One-Sample Statistics
One-Sample Test
Lower Upper
Formularea ipotezelor:
H 0:μ= 33000 (în medie salariul curent nu diferă semnificativ de 33000$)
Decizia statistică:
Pentru Sig.= 7,1%>5% , cu o probabilitate de 95% se acceptă ipoteza nula și se respinge
ipoteza alternativă. Prin urmare salariul curent al angajaților din firmă nu diferă semnificativ de
33000$ .
32
5.2.2. Testarea unei proporții
În testarea unei proportii folosim Binomial Test pentru a testa ipotezele cu privire la o
variabilă distribuită binomial.
Pentru a putea realiza această analiză avem nevoie de o variabilă recodificată cu două
categorii.
Am ales variabila curent salary (salariul curent)
Pentru efectuarea
testării unei
proporții: Analyze – Nonparametrical Tests- Legagy Dialogs – Binomial
Binomial Test
33
Interpretare:
Sig=1.9% indică faptul că proportia de 50% difera semnificativ pentru un risc de 5%.
5.2.3. Testarea diferenței dintre două medii și două (sau mai multe) proporții
Testarea diferentei dintre doua medii
Group Statistics
Formularea ipotezelor:
H 0: μ1= μ2 ( nu există diferențe semnificative între cele două medii)
Interpretare: Nivelul de semnificație al testului este α=0.05> Sig= 0.000, se respinge ipoteza
nulă, se folosesc variante inegale. Astfel, testul t est egal cu -17.430, sig=0 < α=0.05. Garantăm
cu o probabilitate de 95% ca există diferente semnificative intre variatiile pentru cele doua
grupe($24,268.06 pentru categoria de salariu scăzut si $47,072.87 pentru categoria de salariu
ridicat)
34
Pași urmați: Analyze – Comapre Means – Independent Samples T Test
Testarea diferentei dintre doua proporții
Pentru a testa diferența dintre două proporții: Analyze – Nonparametrical Tests- Legagy – Chi-
Square
Formularea ipotezelor:
H0: μ1= μ2=μ 3 (nu există diferențe semnificative între distribuția teoretică și cea reală)
H1: μ1 ≠ μ2 ≠ μ 3 (nu există diferențe semnificative între distribuția teoretică și cea reală)
Se remarcă faptul ca sig = 0.00<0.05 . Cu probabilitate de 95% putem afirma ca exista diferente
semnificative intre grupele distribuției teoretice și a celei reale .
35
Figure 22Testarea diferentei dintre doua proporții
ANOVA
salary categorial
Formularea ipotezelor:
H 0: μ1= μ2=μ 3
H1: μ1 ≠ μ2 ≠ μ 3
Decizie:
Sig. = 19,1%>5% deci se acceptă ipoteza nula ceea ce inseamna ca garantăm o probabilitate de
95% faptul că nu exista diferente semnificative intre mediile de grupă.
Procedeul urmat: Analyze- Compare Means – One Way ANOVA
36
Figure 23 ANOVA - Testarea diferentelor dintre trei si mai multe medii
Concluzii:
După finalizarea studiului cu privire la salariului curent al angajaților din cadrul unei
firme, constatăm că variața acestuia este influențată de variația salariului de încadrare, de
asemenea există o legătură inversă între salariul curent și experiența anterioară.
Cunoaștem și faptul că în medie, salariul actual al unui angajat este de $34,419.57,
precum și faptul că cei mai mulți angajați au salariul curent în valoare de $30,750.
În urma analizei putem garanta cu o probabilitate de 95% că salariul actual mediu se află
în intervalul [$32,878.40; $35,960.73].
37