DATA SCIENCE
1) C’est quoi la data science?
● La Data Science permet de découvrir des connaissances au sein des
données. En plongeant dans ces informations, l’utilisateur peut découvrir et
comprendre des tendances et des comportements complexes. Il s’agit de
faire remonter à la surface des informations pouvant aider les entreprises à
prendre des décisions plus intelligentes.
2) Data sciences bibliothèques :
● Si vous devenez data scientist, vous pénétrerez dans l’intimité de NumPy,
scikitlearn, pandas, seaborn, Matplotlib et d’autres bibliothèques.
3) Anaconda :
● Anaconda est une distribution libre et open source des langages de
programmation Python et R appliqué au développement d'applications
dédiées à la science des données et à l'apprentissage automatique
(traitement de données à grande échelle, analyse prédictive, calcul
scientifique), qui vise à simplifier la gestion des paquets et de déploiement.
3) Jupyter :
● Jupyter Notebook est un outil puissant qui permet aux utilisateurs du langage
Python de créer et de partager des documents interactifs contenant du code
dynamique et exécutable, des visualisations de contenus, des textes de
documentation et des équations.
Les modules de base pour Data science :
● import math
● Import random
● Import statistics
A. Module math :
Le module random en Python est utilisé pour générer des nombres aléatoires
et effectuer des opérations liées à l'aléatoire, comme choisir des éléments au
hasard ou mélanger des séquences.
Les fonctions de base de python :
enumerate(), input(), eval(), open(), format(), len(), print(), range(), zip()
Les fonctions de base pour Data Science :
● abs(var) : la valeur absolue de a.
● round(var) : Renvoi le nombre arrondi à la précision.
● max(liste) : renvoie le max de la liste.
● min(liste) : renvoie le min de la liste.
● sum(liste) : renvoie la somme des éléments de la liste.
● len(liste) : envoie la taille de la liste.
● all(liste) : Retourne true si tout les élément de la liste sont égaux à true.
● any(liste) : Retourne true quand au moins un des éléments égale à true.
Les fonctions de conversion :
● type(var) : Renvoie le type de la variable.
● str(var) : Convertir un nombre entier en chaine de caractère.
● type(var) : Convertir un string à un nombre entier.
● float(var) : Convertir un entier en float.
● print(var) : Convertir une liste au tuple (tuple : (30, 0, 12, 39)).
● list(var) : Convertir un tuple a une liste.
● list([Link]()) : Convertir les clés de dictionnaire a une liste. (clés de dictionnaire :
{“Ahmad”: 20, “rayane”: 10}).
● dict(zip(Nom, Age)) : Convertir des listes au dictionnaire.
Le module NUMPY
En résumé, NumPy est le fondement des calculs numériques en Data Science. Il permet de
manipuler des données de manière rapide, flexible et efficace, ce qui est essentiel pour
analyser et modéliser les données.
NumPy peut gérer de très gros tableaux et est très performante en temps de calcul sur ces
tableaux : les ndarrays prennent en effet moins de place mémoire que d'autres objets Python,
comme par exemple les listes.
Ndarray :
Un ndarray (N-dimensional array) est comme une table bien organisée où on peut ranger des
chiffres, des lettres, ou d'autres données, et accéder facilement à chaque élément.
Un ndarray est comme une boîte spéciale, plus rapide, plus efficace, et conçue pour traiter
beaucoup de données numériques en même temps.
● Un ndarray peut avoir 1 dimension (comme une simple liste).
● Il peut avoir 2 dimensions (comme une feuille Excel avec des lignes et des
colonnes).
● Il peut aussi avoir 3 dimensions ou plus (comme un cube, utile pour des images ou
vidéos).
NDArray (function)
● shape (print([Link])) : trouver les dimensions et la forme d’un tableau.
● size (print([Link])) : le nombre total d’éléments dans le tableau comme
length.
● T: • La transposé d’un tableau à deux est obtenue par l’attribut T.
ex:
● ndim : ndim donne le nombre de dimensions contenues dans NdArray.
(combien de tableaux dans une liste) ex: [[], []] il y en a 2.
● [Link]((3, 5)) est utilisé pour créer un tableau dont tous les éléments sont
0.
● [Link](4, 6) initialiser un tableau (clear the table).
● zeros_like(var[]) si tu as déjà un tableau et tu veux remplir le table par 0.
● [Link]((3. 5)) Remplir tous les éléments de tableaux par 0.
● [Link](5) :
● [Link]((5, 3), 8) : Permet de créer un tableau par un nombre.
● [Link]() : Permet de créer un tableau avec random nombre.
ex :
● l'inscape(début, fin, q) : Renvoie des nombres uniformément espacés sur un
intervalle [début et fin].
ex :
● arrange(début, fin, pas) : Renvoie des nombres uniformément espacés sur un
intervalle [début et fin].
Tableau de trois dimension (3d)
● dtype: Le type de données - dtype dans NumPy est différent des types de données
primitives dans Python, par exemple, dtype a le type avec une résolution plus élevée
qui est utile dans le calcul des données.
vous pouvez définir le type de données de l’élément par des constantes de type
chaîne ou de données dans la bibliothèque NumPy
exemple :
● vstack: Empilez les tableaux en séquence verticale (par rangée).
● hstack: Empilez les tableaux en séquence horizontalement (par colonne).
● column_stack() : couverture tableau 1d en 2d
● [Link]() : il convertit la forme d’un tableau par exemple si le tableau il était 1d il
peut être 2d avec le fonctionne reshape.
si tu multiplié 2 * 4 est il était supérieur au premier tableau il renvoie un erreur.
● [Link](var[], (3, 4)) : comme la fonctionne reshape la différence en l’erreur qui
envoie la fonctionne reshape si les quantité sans différence main rsize il renvoie par
ce type d' erreur.
● ravel utilisée pour convertir transformer des tableaux N-dimensionnels en tableaux à
dimension unique.
● roll utilisée pour dérouler les éléments du tableau le long d’un axe spécifié. (axis=0:
le long des lignes).
NDArray – Accès aux éléments d’un tableau
● accès à un tableau de deux dimension (Indexing) : A[ligne, colonne]
● slicing :
Calcul Mathématiques
● [Link](axis=0) : somme des lignes.
● [Link](axis=1) : somme des colonnes.
● [Link]()
● [Link](axis=1) : max pour les lines d’un tableau.
● [Link](axis): sort les nombre de la liste d'ordre croissant avec retourné les
index de chaque nombre.
● [Link](startNb. endNb, [nbsLigne, nbsCols]) : utilisée pour générer
des nombre entiers aléatoires.
● [Link]
● [Link] : La fonction [Link] de NumPy est utilisée pour trouver les valeurs
uniques dans un tableau.
- [Link](liste) : retourne juste unique nombre de la liste.
- [Link](liste, return_counts=True) : retourne les nombre unique avec count
pour chaque nombre combien il est répété dans la liste.
- unique_values, indices = [Link](x, return_index=True) : cela donne l’indice de
la première apparition de chaque valeur unique.
- unique_values, inverse = [Link](x, return_inverse=True) : Le tableau inverse
montre comment reconstruire le tableau original à partir des valeurs uniques.
[Link] : Une fonction pour vérifier si une valeur est NaN (Not a Number),
[Link](liste): calcule la moyenne du tableau donné le long de l’axe spécifié
[Link](liste) : calcule la moyenne du tableau donné le long de l’axe
spécifié en ignorant les valeurs NaN
[Link]: calcule le produit en points de deux tableaux d’entrée.
MATPLOTLIB
Matplotlib est une bibliothèque Python utilisée pour créer des visualisations de données,
comme des graphiques, des courbes, des histogrammes, des diagrammes en barres, etc
Declare :
import [Link] as plt
Fonctionnes :
[Link](x, y) : Dessiner le diagramme.
[Link]()
[Link]([15, 20, -1, 1]) : zoom un diagramme.
[Link](x, y)
[Link](x, y): Dessiner le diagramme avec des pointes.
[Link](x, y, label="name", c="green", lw=1, ls="--") :
- label : name
- c : couleur
- lw: line width
- ls: line style
[Link]() : pour dessiner le diagramme qui avoir les paramétres
[Link]("title")
[Link]("nameX")
[Link]("nameY")
[Link]("[Link]") : Sauvegarde la figure dans le répertoire de travail.
[Link](2, 1, 2): Les subplots permettent de créer plusieurs graphiques sur une
même figure