Les portails Expasy et NCBI ?
1. Portail Expasy
- Expasy (Expert Protein Analysis System) est le portail de
ressources bioinformatiques géré par le SIB, l'Institut suisse de bioinformatique;
-Un portail extensible et intégrateur qui donne accès à plus de 160 bases de données et
outils logiciels, développés par les groupes du SIB;
- Il soutient une série de domaines des sciences de la vie et de la recherche clinique, de
la génomique, de la protéomique et de la biologie structurale, à l'évolution et à
la phylogénie, à la biologie des systèmes et à la chimie médicale;
- Les ressources individuelles (bases de données, outils logiciels basés sur le web et
téléchargeables) sont hébergées par différents groupes du SIB.
1
Le moteur de recherche Expasy
➢Expasy vous permet d'effectuer des recherches en toute transparence :
1.D'interroger en parallèle un sous-ensemble de bases de données du SIB par une
seule recherche;
[Link] les informations et les connaissances liées à l'ensemble des >160
ressources du portail.
➢Expasy fournit des informations qui sont automatiquement alignées sur la
version la plus récente de chaque ressource, garantissant ainsi une
information à jour. ([Link])
2
3
ExPASy développe (entre autres) :
•La base de données UniProt ("Universal Protein Resource" - créée à l'Université de
Genève en 1986, sous le nom de "Swiss-Prot") : base de données mondiale unique de
séquences et de fonctions des protéines. Uniprot est composée elle-même de deux
sections : Swiss-Prot et TrEMBL
4
•PIR ("Protein Information Resource") : créée en 1984 par NBRF ("National
Biomedical Research Foundation");
•neXtProt : base de données et plate-forme bioinformatique dédiée aux protéines de
l'homme;
•"Swiss-PdbViewer" : programme pour l'analyse, la superposition et la visualisation de
structures 3D de protéines.
5
6
7
2. Portail NCBI
▪Le National Center for Biotechnology Information est un institut national américain pour
l'information biologique moléculaire.
▪Le NCBI conduit des recherches dans la biologie informatique, développe des logiciels pour
analyser des données de génome et fournir des informations biomédicales.
•Le NCBI n'est pas une base de données, mais il développe aussi des bases de données
publiques telles que :
GenBank
dbSNP
RefSeq
PubMed
8
9
10
Les logiciels de BLAST
BLAST ??
-The Basic Local Alignment Search Tool (BLAST) est une méthode de recherche en
bioinformatique qui sert à trouver des régions de similarités locales entre des
séquences.
Le programme compare des séquences nucléotidiques ou protéiques à des bases de
données de séquences et calcule la significativité statistique des alignements ;
11
-Blast peut être utilisé pour déduire des relations fonctionnelles et évolutives entre les
séquences et peut aussi aider à identifier des membres d’une famille de gènes ;
--Le résultat fourni par cet outil est donc une liste de séquences, présentes dans la base de
données et rangées par ressemblance décroissante avec la séquence cherchée.
12
- La méthode d'alignement fournit différentes mesures de ressemblance des séquences entre
elles tel que, le nombre de bases azotées qui sont parfaitement alignées ; c'est ce qu'on
appelle le pourcentage d'identité.
13
Historique
Ce programme a été développé par Stephen Altschul, Warren Gish et David
Lipman au National Center for Biotechnology Information (NCBI).
•Première version produite par le NCBI en 1990 (Altschul et al.,1990), cette
version ne réalise que des alignements sans gaps, mais fournit une p-value qui
permet à l’utilisateur de juger de la significativité des résultats ;
•Une version autorisant les gaps (Blast2) apparaît en 1997 (Altschul et al., 1997)
et inclue le PSI Blast ;
•En 2009, le NCBI sort une nouvelle version de Blast (BLAST+) (Camacho et al.,
2009);
•En 2016, BLAST+2.4.0 released ;
❖Actuellement, Blast 2.9.0+ (1er avril 2019).
PSI-Blast (position-specific iterated BLAST), Blast relancé plusieurs fois par itération. À chaque itération une
séquence consensus est déterminée à partir des résultats, et utilisée comme séquence source pour l'itération
14
suivante ;
Le terme blast peut être modifié en fonction de la nature de la séquence d'entrée, et de la
base de données utilisée :
❖ blastn, de nucléotides, séquence nucléotidique contre une base de données de séquences
nucléotidiques ;
❖ blastp, de protéines, séquence de protéine contre une base de données de séquences de
protéines ;
❖ blastx, séquence nucléotidique traduite en séquence de protéine contre une base de
données de séquences de protéines ;
❖ tblastn, séquence de protéine contre une base de données de séquences nucléotidiques
traduites en séquences de protéines ;
❖ tblastx, séquence nucléotidique traduite en séquence de protéine contre une base de
données de séquences nucléotidiques traduites en séquences de protéines.
15
Les programmes Blast
•Pour les acides nucléiques
1. "MEGABLAST" est l'outil de choix pour identifier une séquence.
2. "Standard nucleotide BLAST" est mieux adapté à la recherche de séquences similaires
mais pas identiques à la séquence requête.
3. L'option "Search for short and near exact matches" de "Nucleotide BLAST" est adapté à la
recherche d'amorces ("primer") ou de courts motifs nucléotidiques.
16
•Pour les protéines, quelques exemples !!
1. Il n'y a pas d'équivalent de "MEGABLAST" pour les requêtes protéiques.
2. "Standard protein BLAST" est le mieux adapté à la recherche de séquences protéiques.
3. "Search for short nearly exact matches" de "Protein BLAST" est adapté à la recherche
de similarité dans le cas de courtes séquences peptidiques.
4. "Nucleotide query - Protein db [blastx]" est adapté pour trouver des séquences
protéiques similaires à celles codées par une séquence requête nucléotidique.
5. "BLAST 2 Séquences" permet la comparaison de 2 séquences requête. La séquence
entrée en second est considérée comme la "base de donnée" contre laquelle est effectuée la
comparaison.
17
Systèmes d’exploration des banques
biologiques
Qu’est ce que ça veut dire ??
- Des outils d’interrogation de banques de données génomiques, appelés en bioinformatique
databank browsers;
- A titre d’exemple : Sequence Retrieval System (SRS), EBI Advanced Search, Entrez,
UniProt Search et BioMart ;
- Il existe d’autre outils dédiés à l’interrogation de plusieurs banques (exemple de BioRS
Integration and Retrieval System) ou dédiés à une banque en particulier .
18
Le système SRS
-Développé par Thrue Etzold, permet d’interroger à partir d’une interface graphique
unifiée toute collection de séquences préalablement indexée par le système;
-Permet aussi une interrogation simple ou croisée sur un ensemble de banques;
-Capable de créer un réseau de références croisées permettant les requêtes et la
navigation entre les banques indexées sous SRS;
-Donner à l’utilisateur la possibilité d’enregistrer ses projets de requêtes sous SRS.
19
Le système Entrez
-Entrez est un système développé et hébergé uniquement par le NCBI;
-Permet l’interrogation et l’extraction des données issues des banques de données
majeures hébergées par cet organisme;
-A partir d’une simple interrogation sur le portail d’Entrez, l’utilisateur peut
naviguer par l’intermédiaire de liens directs entre les données ou via une notion
de voisinage ; cette particularité fait l’originalité d’Entrez par rapport aux
autres systèmes d’interrogation des données biologiques.
20
21