0% found this document useful (0 votes)
4 views3 pages

Python Practive Code

Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as TXT, PDF, TXT or read online on Scribd
0% found this document useful (0 votes)
4 views3 pages

Python Practive Code

Copyright
© All Rights Reserved
We take content rights seriously. If you suspect this is your content, claim it here.
Available Formats
Download as TXT, PDF, TXT or read online on Scribd

filename = "[Link].

csv"
names = ['preg', 'plas', 'pres', 'skin', 'test', 'mass', 'pedi', 'age', 'class']
data = read_csv(filename, names=names)
[Link](kind='density', subplots=True, figsize=(15,17),
layout=(3,3),sharex=False, sharey=False)
[Link]()

import pandas as pd #for handling datasets


import [Link] as sm #for statistical modeling
import pylab as pl #for plotting
import numpy as np #for numerical computation
pd.set_option('display.max_rows',None)

filename = "train_university_admission_data.csv"
names = ['admit','gre','gpa','prestige']
dfTrain = pd.read_csv(filename, names=names)
dfTest = pd.read_csv(filename, names=names)

import pandas as pd #for handling datasets


import [Link] as sm #for statistical modeling
import pylab as pl #for plotting
import numpy as np #for numerical computation
pd.set_option('display.max_rows',None)
filename = "D:\AIML-L2\Dataset\train_university_admission_data.csv"
names = ['admit','gre','gpa','prestige']
dfTrain = pd.read_csv(filename, names=names)
dfTest = pd.read_csv(filename, names=names)

admit gre gpa \


Serial No. GRE Score TOEFL Score University Rating SOP LOR CGPA Research
1 337 118 4 4.5 4.5 9.65 1
2 324 107 4 4 4.5 8.87 1
3 316 104 3 3 3.5 8 1
4 322 110 3 3.5 2.5 8.67 1
prestige
Serial No. GRE Score TOEFL Score University Rating SOP Chance of Admit
1 337 118 4 4.5 0.92
2 324 107 4 4 0.76
3 316 104 3 3 0.72
4 322 110 3 3.5 0.8

filename = "train_university_admission_data.csv"
names = ['admit','gre','gpa','prestige']
dfTrain = pd.read_csv(filename, names=names)
#dfTest = pd.read_csv(filename, names=names)

import pandas as pd #for handling datasets


import [Link] as sm #for statistical modeling
import pylab as pl #for plotting
import numpy as np #for numerical computation
pd.set_option('display.max_rows',None)

filename = "train_university_admission_data.csv"
names = ['admit','gre','gpa','prestige']
dfTrain = pd.read_csv(filename, names=names)
#dfTest = pd.read_csv(filename, names=names)
[Link]('prestige').size()

[Link]('admit').mean()

[Link]
COMPETENCY/Recordings/Forms/[Link]?id=%2Fsites%2Fku%2Dpractice
%2D4044%2FANALYTICS%2DCOMPETENCY%2FRecordings%2FNon%20Academy%2FAIML%2DPython%20for
%20DS%5FL1L2%2DGuru%2DMay20&viewid=aa63c8dc%2D8568%2D4868%2Daad3%2Def4ed0b40a5f

[Link]('prestige').mean()[['gre','gpa']]

print([Link](dfTrain['admit'], dfTrain['prestige'], rownames=['admit']))

[Link](['admit','prestige']).size()......we can also use this

[Link](dfTrain['admit'], dfTrain['prestige'], rownames=['admit']).unstack()

[Link](dfTrain['admit'], dfTrain['prestige'],
rownames=['Admit']).plot(kind='bar')

[Link](dfTrain['admit'], dfTrain['prestige'],
rownames=['Admit']).plot(kind='bar')

[Link](dfTrain['admit'],dfTrain['prestige'],rownames=['Admit'])

prestige best good ok veryGood


Admit
0 28 58 45 64
1 11 25 21 47

prestige best good ok veryGood


Admit
0 28 58 45 64
1 11 25 21 47

[Link](dfTrain['admit'], dfTrain['prestige'], rownames=['admit']).unstack()

.total() we'll add

[Link]('dftrain['admiy'].sum()

can you explain this command : [Link](dfTrain['admit'], dfTrain['prestige'],


rownames=['admit']).unstack()
from Sanjay to everyone:
[Link](dfTrain['admit'], dfTrain['prestige'], rownames=['admit'],
margins=True)

prestige best good ok veryGood All


admit
0 20 73 47 68 208
1 25 19 9 39 92
All 45 92 56 107 300
from Prashant Kumar to everyone:
print([Link](dfTrain['admit'], dfTrain['prestige'], rownames=['admit']).sum())

unstack() function?
from Shivansh Chaudhri to everyone:
dfTrain[dfTrain['admit']==0].sum()
from Gururajan Narasimhan to everyone:
[Link](dfTrain['admit'], dfTrain['prestige'],
rownames=['Admit']).plot(kind='bar')

print([Link](dfTrain['prestige'], dfTrain['admit'], rownames=['prestige']))

doing normalization:
----------------------
X = array[:,0:8]
Y = array[:,8]
scaler = Normalizer().fit(X)
normalizedX = [Link](X)
# summarize transformed data
set_printoptions(precision=3)
print(normalizedX[0:7,:])

doing standardization:
----------------------
X = array[:,0:8]
Y = array[:,8]
scaler = StandardScaler().fit(X)
rescaledX = [Link](X)
# summarize transformed data
set_printoptions(precision=3)
print(rescaledX[1:6,:])

Here, set_printoptions(precision=3) is used to display float numbers uptil 3rd


place after the point

X = array[:,0:8]
Y = array[:,8]
scaler = MinMaxScaler(feature_range=(10, 30))
rescaledX = scaler.fit_transform(X)
# summarize transformed data
set_printoptions(precision=4)
print(rescaledX[0:5,:])

X = array[:,0:8]
Y = array[:,8]
scaler = MinMaxScaler(feature_range=(10, 30))
rescaledX = scaler.fit_transform(X)
# summarize transformed data
set_printoptions(precision=4)
print(rescaledX[0:5,:])

peaor son is usied for the normal disctribution -- mostly used one
kinder and used for ranked distribution
peaor man -- is used for ranked and normal disctributed

what is the difference between correlation and similarity measure?


Correlation is to compareing the two diffrent values
similarity is a mesure for comaring as values

You might also like