0% ont trouvé ce document utile (0 vote)
4 vues36 pages

R et Python en Data Science : Avantages et Usages

Le document présente l'importance de R et Python dans les formations en Data Science, en mettant en avant leur utilisation dans le Master SISE à l'Université Lumière Lyon 2. Il décrit également l'évolution des outils comme SIPINA et Tanagra, ainsi que les critères pour les logiciels de data mining et de data science. Enfin, il souligne la nécessité d'une formation pratique et adaptée aux exigences du marché du travail dans le domaine de la statistique et de l'analyse de données.

Transféré par

bams042001
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues36 pages

R et Python en Data Science : Avantages et Usages

Le document présente l'importance de R et Python dans les formations en Data Science, en mettant en avant leur utilisation dans le Master SISE à l'Université Lumière Lyon 2. Il décrit également l'évolution des outils comme SIPINA et Tanagra, ainsi que les critères pour les logiciels de data mining et de data science. Enfin, il souligne la nécessité d'une formation pratique et adaptée aux exigences du marché du travail dans le domaine de la statistique et de l'analyse de données.

Transféré par

bams042001
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Place de R et Python dans les

formations en Data Science


Ricco Rakotomalala
Université Lumière Lyon 2 – Data, informatique et statistique
[Link]
Meetup – Lyon Data Science – 19 janv. 2018
• Formation en économétrie (statistique, économie mathématique)

• Thèse de doctorat en Machine Learning (Apprentissage statistique)

• Enseignant chercheur, en poste à l’Université Lumière Lyon 2

• Spécialité : statistique, data mining et ses applications, informatique - Data Science

• « Père » des logiciels gratuits SIPINA v.3 et TANAGRA (open source)

R. Rakotomalala - Master SISE


• Auteur d’une dizaine d’ouvrages libres

• Auteur de plus de 500 supports de cours et tutoriels en français et en anglais

• 644 visites par jour depuis 10 ans (depuis le 1er février 2008, compteur Google Analytics)
2
Master SISE (Statistique et Informatique pour la Science des donnéEs)

Meetup – Lyon Data Science – 19 janv. 2018


Existe depuis 1986 – Y intervient depuis 1995 – Responsable depuis 2013

Méthodes statistiques : séries temporelles, analyse


de variance, biostat – données catégorielles
Méthodes de data mining / machine learning :
STATISTIQUE méthodes supervisées, non supervisées, adaptées aux
DATA MINING grandes dimensions, techniques de réduction de
dimension, réseaux de neurones, deep learning.
TD sous R et Python.

R. Rakotomalala - Master SISE


R et Python
tiennent une Traitement des données non
Programmation R et Python. place centrale. structurées : Text Mining, Image Mining,
Bases de données, entrepôts de données, BI. Web mining, analyse des réseaux sociaux.
Reporting - Dataviz (Qlik, Tableau) Analyse des données de sécurité.
Technologies big data (hadoop, spark, Marketing. Professionnalisation, projets
mapreduce, …) transversaux. TD sous R et Python.

INFORMATIQUE APPLICATIONS
(Connaissances métiers)
3
Meetup – Lyon Data Science – 19 janv. 2018
Plan

1. Les prémices (dont SIPINA v3)

2. Tanagra

3. R

R. Rakotomalala - Master SISE


4. Python

5. Etude des offres d’emploi

6. Conclusion

4
Meetup – Lyon Data Science – 19 janv. 2018
Les prémices

R. Rakotomalala - Master SISE


Logiciels (amateurs) pour les statistiques et le data mining

5
Regress

Meetup – Lyon Data Science – 19 janv. 2018


[Link]

• Projet étudiant (Maîtrise d’Econométrie – Université Lyon 2 – 1992) Un peu quand-même :


chargement des données,
• Régression linéaire simple et multiple – Diagnostic de la régression lancement des
traitements, affichage des
• Pas de réelles spécifications (devait permettre de réaliser le projet) résultats, graphiques.

• 1994 : Utilisation par P. Sylvestre-Baron pour ses enseignements. Affinage des spécifications,

extension des fonctionnalités, plus d’interactivité. Piloté par menu.

• 1997 : Amélioration de la gestion de données avec les structures de SIPINA v3

R. Rakotomalala - Master SISE


• 2004 : Intégration dans un pool incluant SIPINA v3 (StatPackage)

Peu documenté (un peu quand même, PSB), peu valorisé,… peu utilisé.
Les principales fonctionnalités ont été reprises dans Tanagra.

Démonstration : infidélité.xls 6
Sipina v2… v2.5

Meetup – Lyon Data Science – 19 janv. 2018


[Link]

• Projet du Laboratoire ERIC, initié par des étudiants du DESS SISE (1994 - 1995)

• Stage de DESS au Laboratoire ERIC (Gestion des règles)

• Maintenance et évolution durant thèse de doctorat (1995 – 1997)

• Pas de réelles spécifications, ni de cible (recherche ? enseignement ?)

• Limité aux arbres de décision, graphes d’induction

• Gestion déficiente des données et faiblesses structurelles ont empêché toutes possibilité d’évolution

R. Rakotomalala - Master SISE


Visibilité Internet – Promotion du Laboratoire ERIC
Un des très rares outils gratuits de data mining diffusé à l’époque
Arbres interactifs exclusivité des logiciels payants

Démonstration : iris 7
Sipina v3…

Meetup – Lyon Data Science – 19 janv. 2018


[Link]

• Projet personnel (1997) nourri par les (dé)boires de la version 2.5

• Axes de réflexion : gestion performante des données, simplification des architectures

internes, extension aux méthodes supervisées

• Tourné essentiellement vers la recherche, support des publications (à partir de 1998)

• Fantasmes de l’industrialisation – Pas de diffusion réelle au départ, statut incertain

R. Rakotomalala - Master SISE


Mis en ligne et documenté à partir de 2004
Reste le seul gratuit avec des arbres interactifs à ce jour
Association avec d’autres outils (Regress, Règles d’association)
Désactivation des modules purement recherche
Très peu d’évolutions depuis 2004

Démonstration : arbres interactifs, multithreading, swap 8


Au-delà de Sipina v3…

Meetup – Lyon Data Science – 19 janv. 2018


Restreint aux méthodes supervisées
Tentative de création d’un pool de logiciels (classification automatique, méthodes factorielles) basés sur le
même gestionnaire de données, sur le modèle de STATISTICA, mais peu concluant

Impossibilité de garder une mémoire des enchaînements des traitements


Pilotage par menu = définition manuelle des traitements, aucune mémoire des enchaînements, obligation de refaire
les mêmes clics à la réouverture du logiciel

R. Rakotomalala - Master SISE


Complexité des structures internes
Pour chaque nouvelle méthode : programmation de l’algorithme, mais aussi programmation de la fenêtre d’affichage des
résultats. Rapport (code utile / code d’interface graphique) pas favorable du tout.

Nécessité d’un outil à la fois plus générique et plus simple (à utiliser, à programmer).

9
Meetup – Lyon Data Science – 19 janv. 2018
Tanagra

R. Rakotomalala - Master SISE


Un logiciel gratuit pour l’enseignement et la recherche
[Link]

10
Contexte (2002)

Meetup – Lyon Data Science – 19 janv. 2018


• Vogue du data mining – Deux ouvrages font date : Lefébure & Venturi (1998), Tufféry (2002)

• Weka (ouvrage de référence en 2000) était le seul outil réellement populaire, mais trop tourné

Machine Learning, pas de culture statistique (ex. régression logistique, méthodes factorielles, etc.)

• Expériences pédagogiques désastreuses avec deux éditeurs de solutions de Data Mining

• Nécessité de développer un outil dédié à l’enseignement

R. Rakotomalala - Master SISE


Réflexion entamée à l’été 2002 (veille techno 1, 2, 3, 4 + maquettes)

Début du développement au printemps 2003


Diffusion en janvier 2004

11
Eléments de réflexion

Meetup – Lyon Data Science – 19 janv. 2018


Evaluer les logiciels gratuits pour l’enseignement du data Mining (Séminaire déc. 2005)

1. S’attacher au fond et non à la forme

L’étudiant ne doit pas être dépendant de l’outil

2. Former des étudiants qui vont sur le marché du travail


Respecter les standards du domaine, conforme à la pratique du data mining (contre-ex. WinIDAMS)

3. L’apprentissage de l’outil ne doit pas requérir des compétences additionnelles

R. Rakotomalala - Master SISE


Avoir à apprendre un langage de script spécifique par ex. rogne sur le temps du data mining

4. (A posteriori) Interfaçage fort avec Excel, outil privilégié du chargé d’études


Excel est systématiquement demandé pour les postes de chargé d’étude (à l’ époque, mais encore aujourd’hui).
Voir aussi les Sondages KDnuggets 2005 et 2017. Le maîtriser est un atout.

12
Spécifications

Meetup – Lyon Data Science – 19 janv. 2018


Calé sur le processus Data
Mining (CRISP-DM)
Critères pour les logiciels de Data Mining

1. Architecture : stand-alone, client-serveur, via un navigateur, …

2. Mode opératoire : diagramme de traitements, langage de script, pilotage par menu,…

3. Performances, capacités de traitement, temps de calcul

4. Accès aux données : fichiers textes, Excel, accès aux bases de données,…

5. Manipulation des données : transformations, recodage,…

R. Rakotomalala - Master SISE


6. Exploration graphique : représentations, visualisations, interactions,…

7. Bibliothèques de techniques de machine learning : supervisées, non-supervisées, …

8. Evaluation et comparaisons : comparaison des approches, benchmarking…

9. Reporting et solutions pour le déploiement (PMML,…)

13
Cahier des charges de Tanagra

Meetup – Lyon Data Science – 19 janv. 2018


1. Gratuité totale – Non commercial – Choix d’une licence privative (Œuvre de l’esprit)
2. Installation simplifiée – Pas de serveurs ou librairies à installer
Utilisateur

3. Gestion simplifiée des données – Connexion avec les tableurs (Excel, Libre/Open Office)
4. Fonctionnement par diagramme de traitements
5. Couvrir les statistiques, l’analyse de données et le data mining dans un cadre unifié
6. Résultats lisibles. Possibilité de les reprendre dans un tableur
7. Mettre de côté les aspects opérationnels (interfaçage BD, reporting dynamique, déploiement)

R. Rakotomalala - Master SISE


Développeur

A. Minimiser le code dédié à la gestion des données et à l’interface (sorties HTML)


B. Gestion simplifiée des méthodes (avec fichier de configuration)
C. Structures permettant l’ajout de toutes méthodes traitant des tableaux « individus x variables »

14
Tanagra – Outil pour la recherche

Meetup – Lyon Data Science – 19 janv. 2018


Accès libre au logiciel = Reproductibilité des expérimentations
Toute publication doit être reproductible en l’état par tout chercheur. Cela n’est possible que si l’outil est accessible
librement (les données aussi d’ailleurs)

Accès libre au code source = Validation des implémentations


Comparer les implémentations permet de les valider, de les améliorer, de les optimiser. Ex. différence de temps de
traitement entre Tanagra et Weka, sur les arbres de décision, sur les SVM, …

R. Rakotomalala - Master SISE


Accès libre au code source = Outil vivant (ex. Gong Yu – version 1.4.20 – Oct. 2007)
Possibilité pour les autres chercheurs d’introduire leurs propres algorithmes pour mener des expérimentations. Un peu
au début, mais très peu l’ont fait finalement…

15
Promotion - Documentation

Meetup – Lyon Data Science – 19 janv. 2018


Ecrire un article de référence
Marque le coup en annonçant le logiciel. Sera la référence citée par les utilisateurs. Deux articles pour Tanagra : EGC 2005,
Revue MODULAD (2005). Participation à quelques conférences, séminaires et ateliers même.

Documenter le logiciel
Sous la forme de tutoriels sur les méthodes plutôt que de rédiger un « manuel de référence » toujours en retard d’une version.
Supports de cours et tutoriels pour d’autres outils (R et Python notamment) ont pris une place importante (prépondérante) !

R. Rakotomalala - Master SISE


Monter un site web
La visibilité internet est une promotion à moindre coût. Un forum a été envisagé puis abandonné, trop énergivore.

Démonstration : infidélité.xls
16
R
Pourquoi R alors qu’il y a déjà Tanagra ?

17

R. Rakotomalala - Master SISE Meetup – Lyon Data Science – 19 janv. 2018


Cours de programmation R en Master de Statistique (2006)

Meetup – Lyon Data Science – 19 janv. 2018


Cours de programmation en Master SISE
Il y a toujours eu un cours de programmation en Master SISE . Compétence indispensable pour un statisticien (ex.
Estimations des régionales pour les soirées électorales de France 3 – Estimations à 20h)

Quel langage enseigner ?


Turbo Pascal, Turbo Pascal pour Windows, Delphi, Java, C++…

R devenait un acteur important du Data Mining / Data Science


Les sondages des KDnuggets (pourtant ce n’était pas totalement évident en 2006)

R. Rakotomalala - Master SISE


Programmation R + Statistiques sous R
Cumuler les avantages : savoir réaliser des traitements sous R (peu l’avaient manipulé avant le
M2 à l’époque) et monter en compétence en programmation

Introduction du cours en M2 à la rentrée de septembre 2007


[Link]
18
R, encore plus indispensable dans le contexte de la Data Science

Meetup – Lyon Data Science – 19 janv. 2018


A chaque étape sont associées des
tâches spécifiques que doivent assurer
les outils / logiciels de data mining.
Préparation des données, modélisation
et présentation sont au cœur du métier

R. Rakotomalala - Master SISE


de statisticien.

([Link]
VARIETE
VOLUMETRIE
VELOCITE 19
Critères pour les logiciels de data science

Meetup – Lyon Data Science – 19 janv. 2018


1. Architecture : stand-alone, client-serveur, via un navigateur, …

2. Mode opératoire : diagramme de traitements, langage de script, pilotage par menu,…

3. Performances, capacités de traitement, temps de calcul

4. Accès aux données : fichiers textes, Excel, accès aux bases de données,…

5. Solutions pour la volumétrie, technologies big data

6. Accès aux données non structurées et primitives de traitements (texte, image, …)

7. Interfaçage avec les API du web (ex. Twitter, Google+, Google Analytics, …)

R. Rakotomalala - Master SISE


8. Manipulation des données : transformations, recodage,…

9. Exploration graphique : représentations, visualisations, interactions,…

10. Bibliothèques de techniques de machine learning : supervisées, non-supervisées, …

11. Evaluation et comparaisons : comparaison des approches, benchmarking…

12. Reporting et solutions pour le déploiement (PMML,…)


20
Atouts pour l’enseignement

Meetup – Lyon Data Science – 19 janv. 2018


Richesse des bibliothèques de data mining (machine learning, statistique, …)
Grâce au système des packages, extensible à l’infini. Attention à la validité des packages proposés (The R Journal).
Exploration facilitée des nouveaux domaines (ex. Analyse des données spatiales)

Programmation statistique (ex. nouvelles méthodes de data mining, etc.)


Le langage le permet facilement. Production des solutions « clés en main » avec le développement des packages. Ce savoir faire
est un véritable atout pour les étudiants. De plus en plus d’offres de stage !

Programmation Big Data


Programmation avancée MapReduce (Hadoop). Programmation parallèle. Une vraie compétence additionnelle qui

R. Rakotomalala - Master SISE


fait le lien avec l’analyse fine des algorithmes de data mining.

Accès aux données exotiques – Utilisation des API


La profusion des packages ouvre démultiplie les possibilités d’accès aux données (ex. Google Analytics). Packages pour le
traitement des données non-structurées (ex. Text Mining)

L’éclectisme de R facile l’acquisition des compétences additionnelles


21
Démo – Analyse prédictive

Meetup – Lyon Data Science – 19 janv. 2018


Prédiction de l’infidélité

Ensemble Construction de la fonction f(.) à


d’apprentissage partir des données d’apprentissage

Y = f(X1,X2,…) + 

Application du modèle (prédiction)


sur l’ensemble de test

R. Rakotomalala - Master SISE


Ensemble
de données Mesures de performances par
(dataset) (Y , Yˆ ) confrontation entre Y et Y^ : matrice
de confusion + indicateurs
Y : valeurs observées
Ensemble de test Y^ : valeurs prédites par f(.)

22
Démo – Text Mining – Catégorisation de documents

Meetup – Lyon Data Science – 19 janv. 2018



<document>
<sujet>acq</sujet>
<texte>
Etiquetage automatique des nouvelles de « Reuters »
Resdel Industries Inc said it has
agreed to acquire San/Bar Corp
in a share-for-share exchange,
after San/Bar distributes all
Y X1 X2 X3 X4
shgares of its Break-Free Corp
Corpus Construction
subsidiary to San/Bar
shareholders on a share-for-share
Φ 𝑋, 𝛼 du classifieur.
d’apprentissage
basis.
</texte>
</document> Collection de Extraction du dictionnaire + constitution
de la matrice documents termes.
Application du
<document> D étiquetés classifieur sur
<sujet>acq</sujet> l’échantillon test
<texte>
Warburg, Pincus Capital Co L.P., Corpus
an
investment partnership, said it Y Y^ Calcul des
Y X1 X2 X3 X4

R. Rakotomalala - Master SISE


told representatives of Symbion indicateurs
Inc it would not increase the 3.50-
Corpus de test
d’évaluation : taux
dlr-per-share cash price it has
d’erreur, rappel,
offered for the company. In a filing
with the Securities and Exchange etc.
On utilise le dictionnaire issu de l’apprentissage +
Commission, Warburg Pincus
said one of its top executives, constitution de la matrice documents termes. Attention,
Rodman Moorhead, who is also a si TF-IDF, utilisation de l’IDF issu de l’apprentissage.
Symbion director, met April 1 with
Symbion's financial advisor, L.F.
Rothschild, Unterberg, Towbin
Inc.
</texte>
</document>
… 23
Démo – Programmation MapReduce

Meetup – Lyon Data Science – 19 janv. 2018


Une interprétation du calcul distribué / parallélisation des calculs
Calcul de la somme d’un vecteur

Clients

Switch

Nœud maître
Nœud
3

R. Rakotomalala - Master SISE


Nœuds esclaves
Nœud 5
Ordinateur 1
= Serveur 1 Nœud 4
Nœud 2
= Nœud 1
[Link]

Grappe de machines

24
Python
Pourquoi Python alors qu’il y a déjà R ?

25

R. Rakotomalala - Master SISE Meetup – Lyon Data Science – 19 janv. 2018


Cours de programmation en L3 IDS (2014)

Meetup – Lyon Data Science – 19 janv. 2018


Cours de programmation en L3 IDS (Informatique et Data Science)
Couplage avec un cours d’algorithmie. « Initiation » à la programmation. Était basé sur Delphi/Lazarus (langage Pascal).
Avantages pédagogiques : bases de la programmation + prog. évènementielle + interfaces graphiques

Faire évoluer l’enseignement sans verser dans le phénomène de mode


De plus en plus d’articles en parlent en tant qu’outil pédagogique (ex. Python et enseignement, Juillet 2014) et outil
professionnel dans notre domaine (Python et Big Data, Mars 2015). On est au-delà de l’épiphénomène.

Etre en phase avec le marché du travail

R. Rakotomalala - Master SISE


Au-delà des aspects pédagogiques, les offres d’emploi pour Delphi ne sont pas légions ([Link], 69 offres au 17/01/2018).
Elles sont un « tout petit peu » plus nombreuses pour Python ([Link], 1145 offres au 17/01/2018).

Introduction du cours en L3 à la rentrée de septembre 2015


[Link]

26
Python en Master Data Science

Meetup – Lyon Data Science – 19 janv. 2018


Python un acteur incontournable de la Data Science
Progression forte ces dernières années (Sondage KDnuggets, Mai 2015),
au point de dépasser (supplanter ?) R aujourd’hui (Août 2017).

Python présent dans les offres d’emploi Data Science / Big Data en France
Dans les offres d’emploi estampillées « data science », Python est incontournable (ex. Data Science Job Report, 2017). Voir l’étude
des étudiants du Master SISE (recensement et qualification d’offres d’emploi statistique, data mining, data science, BI,…).

Richesse de la bibliothèque Big Data / Data Science


Elles complètent celles de R. Certaines sont plus compétitives (ex. Text mining – NLTK – semble plus complet) ou plus
novatrices (ex. Deep Learning).

R. Rakotomalala - Master SISE


La difficulté (pédagogique) additionnelle par rapport à R est faible
Python est plus généraliste que R. Mais, dans nos domaines, le passage de l’un à l’autre est relativement facile au final. Voir
le projet de « Reconnaissance faciale » et son contexte. On peut maîtriser facilement l’un ET l’autre.

En réalité, Python et R se complètent. Il nous appartient de


déterminer le plus adapté selon les circonstances et les objectifs.
27
Démo – Analyse prédictive

Meetup – Lyon Data Science – 19 janv. 2018


Détection de spams

Ensemble Construction de la fonction f(.) à


d’apprentissage partir des données d’apprentissage

Y = f(X1,X2,…) + 

Application du modèle (prédiction)


sur l’ensemble de test

R. Rakotomalala - Master SISE


Ensemble
de données Mesures de performances par
(dataset) (Y , Yˆ ) confrontation entre Y et Y^ : matrice
de confusion + indicateurs
Y : valeurs observées
Ensemble de test Y^ : valeurs prédites par f(.)

28
Démo – Reconnaissance faciale

Meetup – Lyon Data Science – 19 janv. 2018


Démarche de recherche d’information par le contenu. Projet en Python.

Disposer d’une Matrice de description, ligne :


banque d’images individus, colonnes : caractéristiques.

X1 X2 X3 X4 X5

Extraction de
caractéristiques

Recherche de similarités.

R. Rakotomalala - Master SISE


Extraction de
caractéristiques
X1 X2 X3 X4 X5

Vecteur de description Identification


Image « requête » de l’individu « requête » avec degré de
fiabilité. 29
Démo - Reconnaissance musicale

Meetup – Lyon Data Science – 19 janv. 2018


Démarche de recherche d’information par le contenu. Projet en Python.

Disposer d’une
banque de musiques
Matrice de description, ligne :
chansons, colonnes : caractéristiques.

Extraction de
X1 X2 X3 X4 X5

caractéristiques

Matching + recherche

R. Rakotomalala - Master SISE


de similarités.
Extraction de
caractéristiques
X1 X2 X3 X4 X5

Chanson « requête » Vecteur de description de


la chanson « requête »
Identification et
recommandation
30
Démo – Détection de communautés

Meetup – Lyon Data Science – 19 janv. 2018


Code comparé Python et R pour la détection
des communautés dans les réseaux sociaux

R. Rakotomalala - Master SISE


Point de départ : des individus plus Découvrir des individus centraux (centralité) autour
ou moins connectés entre eux. desquels s’agglomèrent des communautés. Identifier
les individus qui peuvent jouer le rôle de relais.
31
Meetup – Lyon Data Science – 19 janv. 2018
Analyse des offres d’emploi

R. Rakotomalala - Master SISE


Positionnement des outils dans les offres d’emploi

32
Analyse des offres d’emploi

Meetup – Lyon Data Science – 19 janv. 2018


Analyse de documents textuels (text mining) et Mots clés fréquents
selon les métiers
classement / classification. Projet sous R (Shiny)

Offres d’emploi qui ont été


étiquetées manuellement.

Analyse et développement
d’un application Shiny Association entre les
termes dans les offres.

R. Rakotomalala - Master SISE


Métiers : Chargés d’études
statistique, consultant BI, data
analyst, data engineer, data
manager, data miner, data scientist,
data visualisation

Identification des métiers


selon les termes de l’offre. 33
Conclusion
R et Python réellement incontournables ?

34

R. Rakotomalala - Master SISE Meetup – Lyon Data Science – 19 janv. 2018


Enquête Kdnuggets + Etude Gartner Evaluation de 16 outils analytiques commerciaux

Meetup – Lyon Data Science – 19 janv. 2018


(pas tous) sur la base de 15 critères. (Février 2017,
On demande aux internautes d’indiquer les logiciels Data Science Platforms: gainers and losers).
qu’ils utilisent (Mai 2017, 2900 votants) (2017 Software
Polls Results) + Analyse détaillée (Juin 2017),
notamment des associations entre outils.

R. Rakotomalala - Master SISE


Codes de lecture ([Link]) :

Leaders execute well against their current vision and are well
positioned for tomorrow.
Visionaries understand where the market is going or have a vision
for changing market rules, but do not yet execute well.
Niche Players focus successfully on a small segment, or are
unfocused and do not out-innovate or outperform others.
Challengers execute well today or may dominate a large segment, 35
but do not demonstrate an understanding of market direction.
Conclusion

Meetup – Lyon Data Science – 19 janv. 2018


R et Python proposent des fonctionnalités et des performances
opérationnelles. Ils sont incontournables aujourd’hui dans la Data Science.
Les éditeurs de logiciels l’ont compris et les intègrent dans leurs solutions.

• Il faut une formation dédiée et de la pratique pour savoir


réellement tirer parti de ces outils (d’où la profusion de MOOC…).

R. Rakotomalala - Master SISE


• Pas R ou Python mais plutôt R et Python. Et bien maîtriser les
deux n’est pas un problème.
• Le choix dans la pratique dépend du contexte, des objectifs de
l’étude, des packages disponibles et de leur qualité, etc.

36

Vous aimerez peut-être aussi