Machine Translated by Google
Science des données
Machine Translated by Google
Contenu
1. À propos de
nous 2. Instructions
3. Soumission 4.
Liste des tâches
Machine Translated by Google
À propos de nous
Bienvenue chez Codveda Technology, où l'innovation rencontre l'excellence. Fondée
avec la vision d'offrir aux entreprises des solutions informatiques de pointe, nous sommes
spécialisés dans la fourniture de services sur mesure qui contribuent à leur réussite à
l'ère du numérique.
Chez Codveda, nous proposons une gamme diversifiée de services, notamment le
développement Web, le développement d'applications, le marketing numérique,
l'optimisation du référencement, l'automatisation de l'IA/ML et l'analyse de données.
Notre équipe de professionnels qualifiés s'engage à aider les entreprises à libérer leur
plein potentiel en fournissant des solutions innovantes, évolutives et fiables.
Machine Translated by Google
INSTRUCTIONS
Mettez à jour votre profil LinkedIn avec vos réalisations, notamment votre lettre
d'offre et votre certificat de fin de formation. Mentionnez et identifiez @Codveda
dans vos publications.
Utilisez des hashtags tels que #CodvedaJourney, #CodvedaExperience et
#FutureWithCodveda pour présenter vos progrès et vos expériences.
Partagez les mises à jour de l'achèvement de votre projet sur LinkedIn,
accompagnées d'une explication vidéo et du lien du référentiel du projet GitHub.
Quatre tâches vous seront confiées. Sélectionnez et réalisez trois tâches de votre
domaine pour satisfaire aux exigences du stage.
Soumettez vos tâches terminées via le formulaire de soumission Codveda. Assurez
vous que toutes les tâches sont soumises dans le délai imparti de 15 jours.
Machine Translated by Google
SOUMISSION
Créez une vidéo professionnelle présentant vos projets de stage et vos
réalisations.
Hébergez la vidéo sur LinkedIn pour prouver votre travail et gagner en
crédibilité auprès de vos pairs. Pensez à taguer Codveda Technology dans
vos publications pour être sûr d'être informé de votre travail grâce à des
hashtags comme #CodvedaAchievements et #CodvedaProjects.
Un formulaire de soumission vous sera envoyé ultérieurement. D'ici là,
veuillez poursuivre vos tâches et conserver un fichier distinct pour chaque niveau.
Lorsque vous publiez votre vidéo sur LinkedIn, incluez du contenu engageant
qui met en valeur vos contributions et vos compétences. Adaptez votre
publication à votre domaine de stage pour maximiser l'impact et la visibilité.
Machine Translated by Google
Niveau 1 Tâche 1 : Collecte de données et Web
(Basique) Grattage
Description : Collectez des données à partir d’un site Web à l’aide de
techniques de scraping Web.
Objectifs :
Identifiez un site Web cible et inspectez sa structure.
Utilisez BeautifulSoup et les bibliothèques de requêtes pour extraire des
données des pages Web.
Stockez les données récupérées dans un format structuré (par exemple,
CSV, JSON).
Gérez les défis courants tels que la pagination et le contenu dynamique.
Outils : Python, BeautifulSoup, requêtes, pandas.
Machine Translated by Google
Niveau 1 Tâche 2 : Nettoyage des données et
(Basique) Prétraitement
Description : Nettoyer et prétraiter un ensemble de données
brutes pour le rendre adapté à l’analyse.
Objectifs :
Gérer les données manquantes (par exemple, imputation, suppression).
Détecter et supprimer les valeurs aberrantes.
Convertissez les variables catégorielles en format numérique à l'aide du codage
onehot ou du codage d'étiquette.
Normaliser ou standardiser les données numériques.
Outils : Python, pandas, scikitlearn
Machine Translated by Google
Niveau 1 Tâche 3 : Données exploratoires
(Basique) Analyse (EDA)
Description : Effectuer une analyse exploratoire des données
pour comprendre la structure sousjacente et les tendances des données.
Objectifs :
Calculer des statistiques récapitulatives (moyenne, médiane, variance, etc.).
Visualisez les données à l’aide d’histogrammes, de nuages de points et de boîtes
à moustaches.
Identifier les corrélations entre les caractéristiques numériques à l’aide d’une matrice
de corrélation.
Générer un rapport résumant les informations issues de l’EDA.
Outils : Python, pandas, matplotlib, seaborn.
Machine Translated by Google
Niveau 2 Tâche 1 : Modélisation prédictive
(Intermédiaire) (Régression)
Description : Construire et évaluer un modèle de régression pour
prédire une variable continue (par exemple, les prix des maisons).
Objectifs :
Divisez l’ensemble de données en ensembles d’entraînement et de test.
Entraînez un modèle de régression linéaire à l’aide de scikitlearn.
Évaluez le modèle à l’aide de mesures de performance telles que l’erreur
quadratique moyenne (MSE) et le Rcarré.
Expérimentez avec plusieurs modèles (par exemple, arbres de décision, forêt
aléatoire) et comparez les performances.
Outils : Python, scikitlearn, pandas, matplotlib.
Machine Translated by Google
Niveau 2 Tâche 2 : Classification avec logistique
(Intermédiaire) Régression
Description : Construisez un classificateur d'arbre de décision pour
prédire un résultat catégoriel (par exemple, prédire les
espèces de fleurs).
Objectifs :
Prétraiter les données (par exemple, gérer les fonctionnalités catégorielles, mettre à
l'échelle les fonctionnalités).
Former et évaluer le modèle de régression logistique.
Utilisez des mesures telles que l’exactitude, la précision, le rappel et la
courbe ROC pour l’évaluation.
Comparez la régression logistique avec d’autres classificateurs comme
Random Forest ou SVM.
Outils : Python, scikitlearn, pandas, matplotlib.
Machine Translated by Google
Niveau 2 Tâche 3 : Clustering (non supervisé)
(Intermédiaire) Apprentissage)
Description : Implémentez le clustering KMeans pour regrouper
les points de données en clusters sans étiquettes (par
exemple, segmentation client).
Objectifs :
Appliquer le clustering KMeans à l’ensemble de données.
Utilisez la méthode du coude ou le score de silhouette pour déterminer le
nombre optimal de clusters.
Visualisez les clusters dans l'espace 2D à l'aide de PCA ou tSNE pour la
réduction de la dimensionnalité.
Interpréter les résultats du regroupement et résumer les principales
conclusions.
Outils : Python, scikitlearn, matplotlib, seaborn.
Machine Translated by Google
Niveau 3 Tâche 1 : Analyse des séries chronologiques
(Avancé)
Description : Analyser et modéliser des données de séries chronologiques pour
prévoir les valeurs futures (par exemple, les cours des actions, les ventes).
Objectifs :
Tracez et décomposez la série chronologique en
composantes de tendance, de saisonnalité et résiduelles.
Mettre en œuvre des techniques de moyenne mobile et de lissage
exponentiel.
Construisez un modèle ARIMA ou SARIMA pour la prévision.
Évaluez le modèle à l’aide de mesures telles que RMSE et visualisez les
prévisions.
Outils : Python, pandas, statsmodels, matplotlib.
Machine Translated by Google
Niveau 3 Tâche 2 : Langage naturel
(Avancé) Traitement (NLP) Texte
Classification
Description : Classer les données textuelles en catégories (par
exemple, spam ou nonspam, analyse des sentiments).
Objectifs :
Prétraiter les données textuelles (tokenisation, suppression
des mots vides, stemming/lemmatisation).
Convertissez du texte en représentation numérique à l'aide de TFIDF ou
Word2Vec.
Entraînez un modèle de classification (par exemple, Naive Bayes,
régression logistique) sur le texte traité.
Évaluez le modèle en utilisant la précision, le rappel et le score F1.
Outils : Python, nltk, scikitlearn, pandas.
Machine Translated by Google
Niveau 3 Tâche 3 : Réseaux neuronaux avec
(Avancé) TensorFlow/Keras
Description : Construisez et entraînez un réseau neuronal simple à
rétroaction directe pour classer des images ou des données structurées.
Objectifs :
Chargez un ensemble de données (par exemple, des chiffres MNIST ou un
ensemble de données structuré) et prétraitezle.
Concevez une architecture de réseau neuronal à l’aide de TensorFlow ou Keras.
Entraînez le modèle à l’aide de la rétropropagation et évaluezle à l’aide de
courbes de précision et de perte.
Ajustez les hyperparamètres (par exemple, le taux d'apprentissage, la taille du lot)
pour améliorer les performances.
Outils : Python, TensorFlow, Keras, pandas, matplotlib.
Machine Translated by Google
Comment
nous contacter?
Pour plus d'informations, veuillez
contacter notre équipe.
@codveda
support@[Link]
[Link]