lOMoARcPSD|33465914
Correction TP bioinformatique
Biologie moléculaire 3 (Université Toulouse-III-Paul-Sabatier)
Scan to open on Studocu
Studocu is not sponsored or endorsed by any college or university
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
[Link]
TP Bioinformatique (2h)
module EDSVB3BM/EDSVA3BM Biologie Moléculaire
Quelques liens
EBI EMBOSS nederlands EMBOSS Génopole ExPASy NCBI Pasteur Pôle
BIoinfo Lyonnais Primer3
Quelques "trucs" utiles :
- CtrlA permet de tout sélectionner sur une page
- Ctrl C permet de copier un texte sélectionné
- Ctrl V permet de le coller.
- Ctrl F permet de chercher un mot sur une page
Avant de commencer :
Ouvrez l'éditeur de texte Bloc-notes, vous y collerez certains résultats.
But du TP : ce n’est pas de la « bioinfo ». Ce sont juste quelques outils et logiciels
disponibles via le web qui sont aujourd’hui des outils de bases de préparation
d’expériences de biologie moléculaire.
Vous vous intéressez à une protéine humaine, potentiellement impliquée dans l'apoptose, dont
voici la partie codante de la séquence d'ADNc :
>THAP1_humaine
ATGGTGCAGTCCTGCTCCGCCTACGGCTGCAAGAACCGCTACGACAAGGACAAGCCCGTTTCTTTCCACA
AGTTTCCTCTTACTCGACCCAGTCTTTGTAAAGAATGGGAGGCAGCTGTCAGAAGAAAAAACTTTAAACC
CACCAAGTATAGCAGTATTTGTTCAGAGCACTTTACTCCAGACTGCTTTAAGAGAGAGTGCAACAACAAG
TTACTGAAAGAGAATGCTGTGCCCACAATATTTCTTTGTACTGAGCCACATGACAAGAAAGAAGATCTTC
TGGAGCCACAGGAACAGCTTCCCCCACCTCCTTTACCGCCTCCTGTTTCCCAGGTTGATGCTGCTATTGG
ATTACTAATGCCGCCTCTTCAGACCCCTGTTAATCTCTCAGTTTTCTGTGACCACAACTATACTGTGGAG
GATACAATGCACCAGCGGAAAAGGATTCATCAGCTAGAACAGCAAGTTGAAAAACTCAGAAAGAAGCTCA
AGACCGCACAGCAGCGATGCAGAAGGCAAGAACGGCAGCTTGAAAAATTAAAGGAGGTTGTTCACTTCCA
GAAAGAGAAAGACGACGTATCAGAAAGAGGTTATGTGATTCTACCAAATGACTACTTTGAAATAGTTGAA
GTACCAGCATAA
La séquence est ici au format FASTA :
>nom, ou description. Sur une seule ligne
Séquence : sans espace, ni chiffre
La plupart des programmes d’analyse de séquences demandent ce format : il faut le
connaître ! Vous l’utiliserez pour la suite
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
I- Criblage d'une banque d'ADNc
Afin d'étudier le rôle de cette protéine vous décidez de travailler sur la souris.
Vous disposez dans votre laboratoire d'une banque d'ADNc de souris que vous allez cribler
avec une sonde spécifique de votre séquence d'intérêt.
On choisit de prendre comme sonde les 27 premiers nucléotides (soulignés).
Avec le programme BLAST, vous allez comparer ce fragment aux séquences de souris
disponibles sur le serveur du NCBI.
Coller le fragment de séquence en haut et choisir la Database "RefSeq RNA"
Cochez la case Exclude Models (XM/XP)
(supprime les séquences hypothétiques)
puis cliquer sur
NB : ici le lien BLAST amène directement sur la page BLAST contre les données souris
C’est noté en haut de la page : Mus musculus (house mouse) Nucleotide BLAST
Le programme BLAST permet de comparer rapidement une séquence à tout un ensemble de
séquences.
- Trouvez-vous des ARNm de souris alignés avec votre sonde ? Combien ?
- Au(x)quel(s) la sonde est-elle complètement alignée ?
- Votre sonde vous paraît-elle spécifique ?
Le programme BLAST = programme pour aligner rapidement 1 séquence à une banque
de séquences donc à bcp de séquences. Ici la banque contient >376 000 séq, ça prend
qques secondes seulement (il faut cliquer sur Search Summary pour voir le nombre de
séq).
BLAST est utilisé par tous les biologistes, c’est la base des analyses de séquences.
On a plusieurs onglets
Onglet Graphic summary :
la séquence Query (requête)=notre sonde de 27nt
Chacune des lignes est 1 séquence qui ressemble à la nô tre au moins sur une région
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
Onglet Descriptions : tableau avec pour chaque séquence retrouvée : son nom (desc),
des scores (note pour le niveau de ressemblance), un Query cover = proportion de notre
séq qui est alignée à une autre, Evalue (valeur statistique), un poucentage d’identité
entre les 2 séq, et le code (numéro accession) de la séq trouvée
Onglet Alignments : on voit réellement la correspondance (alignement) entre notre séq
et celle(s) qu’on trouve
NB : ARNm et ADNc c’est la même chose en « bioinfo » : les ARNm ne sont pas séquencés
directement, il faut synthétiser les ADNc, qui eux, sont séquencés. Donc en fait dans les
banques il n’y a que des ADNc, des fois on les étiquète ADNc et des fois ARNm…
- On a 100 ARNm alignés, car le programme retourne tjs les 100 meilleurs résultats
(écrit en haut du Graphic Summary)
- 1 seul sur lequel la sonde s’aligne entièrement (regarder la colonne Query
cover=100%)
Mus musculus THAP domain containing, apoptosis associated protein 1(Thap1), mRNA
= Accession : NM_199042.2
On regarde l’alignement en cliquant sur le lien dans la colonne description (ou onglet
Alignments) : on a bien 100% id sur les 27nt
- la sonde est donc spécifique : elle ne s’aligne à 100% qu’avec un ARNm. Avec les autres
ARNm alignement seulement sur une partie. Donc dans des conditions de stringence
suffisante, on n’hybridera qu’un type de clones : ceux qui contiennent l’ADNc de
NM_199042.
Attention : avec BLAST on regarde des alignements des séquences, donc on trouve une
séquence identique. Comme on travaille sur des ADNc, ça veut dire que le brin
complémentaire va s’hybrider à la sonde. BLAST permet de « mimer » ce qui va se passer
quand on criblera la banque d’ADNc car le génome de souris est entièrement séquencé
donc il y a tous les ARNm (ou ADNc) dans la banque qu’on interroge.
II- Recherche de la protéine codée par un ARNm
Votre sonde vous permet donc d'hybrider un ADNc, que vous faites séquencer. Cet ADNc
devrait être exactement le même que celui obtenu avec BLAST.
Cliquer donc sur le lien NM_199042.2
En haut de la page cliquez sur le lien FASTA (FASTA est un format de présentation des
séquences).
Quand on clique sur le lien NM_199042.2, on accède à la « fiche d’identité » de la
séquence : on voit son nom, son organisme, les publications associées, les informations,
puis la séquence
En cliquant ensuite sur le lien FASTA, on affiche juste la séquence au format FASTA, donc
avec une première ligne qui commence par > cette ligne est l’ entête FASTA
Coller cette séquence dans l'éditeur.
Au niveau de l'entête FASTA, donnez-lui un nom parlant, par exemple >ADNc_souris (NB : jamais
d'espace dans les noms !)
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
1- Cherchez sur cette séquence l'ORF la plus probable. Pour cela :
Avec la suite logicielle EMBOSS, dans la rubrique Nucleic translation, utilisez sixpack en
modifiant les paramètres suivants :
ORF at the begining of the sequence: No
ORF at the end of the sequence: No
ORF start with an M : yes
Minimum size of ORFs=30.
Regardez les traductions dans les différents cadres de lecture
(les zones en majuscules sont des ORF potentielles (régions entre 2 codons Stop, plus
grandes que 30 AA après traduction).
Quelle ORF vous paraît être la plus probable ? Pourquoi ?
ORF=Open Reading Frame=séquence qui ne contient pas de Stop donc limitée par 2
Stops. Nous, on veut juste la partie qui sera traduite (séquence codante) donc on a mis
option « ORF start with an M »
Rappel : un ARNm n’est pas entièrement traduit en protéine ! Avant et après la séquence
codante il y a les Régions Terminales non Traduites appelées 5’ et 3’UTR (Untranslated
Terminal Region) (donc l’ORF ne sera ni au début ni à la fin de la séquence)
Ce qu’on voit = double brin ADN et ligne F1, F2, F3 = traduction (code à 1 lettre des AA)
dans les 3 cadres de lecture du brin direct ; F4, F5, F6 = traduction dans les 3 cadres de
lecture du brin complémentaire
Les lettres sont en majuscules si au moins 30AA sans Stop
les *= les stops ; il y a 3 codons stop UAG, UGA, UAA
Ce qu’on cherche = la zone la plus longue en majuscule, donc sans Stop.
Hypothèse : s’il y a une très grande zone sans stop, c’est que c’est là que la protéine est
codée. Parce que dans les zones non codantes il y a des Stop partout
En bas de la page, le programme a extrait les ORF (commençant à M et + grandes que
30AA)
On suppose que c’est la + grande ORF qui est la bonne. C’est une hypothèse, pas tjs vraie,
en particulier quand il y a plusieurs ORFs de tailles voisines, on ne sait pas a priori
qu’elle est la bonne. Dans notre cas, pas de problème, 1 seule ORF longue => 210 AA. Les
autres sont très petites.
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
2- Utilisez maintenant le programme ORF Finder au NCBI pour refaire la recherche d’ORF :
Interprétez le graphique obtenu.
Notez bien les positions de l'ORF.
ORF finder fait comme SixPack mais interface graphique
Attention : par défaut ORF finder cherche des ORF de taille min 75nt, donc on en a plus
qu’avec SixPack (on avait fixé à 30AA min=90nt)
Si on clique sur Six-Frame translation… (au dessus du tableau) => Add six frame
translation track : on voit les stops (en rouge) et les ATG (en vert) : il y a bien des stops
partout ! sauf sur l’ORF
Dans le tableau les ORF sont par taille décroissante (car on fait tjs l’hypothèse que c’est
la + grande la bonne)
On retrouve bien notre ORF de 210 AA
ORF : 283-915
Quand on sélectionne l’ORF1, sur la gauche la protéine issue de sa traduction s’affiche
Récupérez la séquence protéique. Collez cette séquence dans l'éditeur. Comme
précédemment, changer son nom
Récapitulatif :
On part d’une séquence ADNc humaine de THAP1. On veut travailler sur la souris donc
on va cribler une banque ADNc souris avec une sonde. La sonde = 27 premiers nucl. Elle
est spécifique puisqu’avec BLAST on ne voit qu’1 ARNm sur lequel la sonde s’aligne à
100%.
Sur l’ARNm de souris qu’on obtient : on cherche l’ORF (sixPack et ORF finder)=> on a
une protéine de 210 AA.
Il faut s’assurer que la protéine de souris et humaine se ressemblent !
III- Comparaison de séquences
Vous devez maintenant vérifier que cette protéine est bien l'homologue chez la souris de la
protéine THAP humaine.
Homologues = 2 séquences apparentées, ici dérivées d’un événement de spéciation. Elles
auront vraisemblablement la même fonction dans les 2 organismes
1- Il vous faut donc d'abord déduire la protéine THAP humaine de sa séquence d'ADNc :
choisissez la méthode que vous voulez.
En partie II, on avait l’ADNc de souris, on a déduit la protéine de souris, avec une
recherche d’ORF
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
Faire pareil avec l’ADNc humain (donné au début du TP, la séquence entière cette fois !) :
on choisit soit SixPack, soit ORF finder pour chercher l’ORF
Pourquoi la protéine correspond-elle à la totalité de la séquence nucléique ?
Avec ORF finder on a :
L’ORF correspondant à la totalité de la séquence de 1 à 642
Pourtant un ARNm n’est JAMAIS entièrement traduit en protéine, il y a des UTRs !
Ici la séquence donnée au début du TP est uniquement la partie codante de l’ADNc
(relire la première phrase du TP), donc l’ORF avait déjà été extraite. Il n’y a pas les UTRs
Sur la séquence d’ADNc de souris par contre on avait des UTR puisque l’ORF est entre
283 (donc 5’UTR de 1 à 282) et 915 (donc 3’UTR de 916 à 2267)
Collez la protéine déduite dans l'éditeur. La renommer.
2- Retournez sur EMBOSS, dans la rubrique Alignment global, utilisez needle pour aligner
les séquences protéiques de souris et humaines.
Quelle est votre conclusion ?
Attention : il faut bien mettre les séquences au format FASTA pour que le nom s’’affiche,
et il vaut mieux renommer les séquences « >prot_souris » et « >prot_humaine » par
exemple…
Les séquences sont très proches : 92.5% identité, 94.4% similarité.
Les AA similaires sont là où il y a « : »: E (ac. Glutamique) / Q (Glutamine)
R (Arginine) / K (Lysine), D (ac. Aspartique) /E (ac. Glutamique)
Ce sont des AA proches, qui vont souvent être changé l’un par l’autre (substitution)
entre les séquences homologues
Les - sont délétions chez la séquence de souris ou insertions chez la séquence humaine
(ça dépend comment l’évolution s’est faite…), puisque le protéine humaine fait 213AA et
celle de souris 210AA.
Les séquences se ressemblent bcp, elles s’alignent sur toute leur longueur => elles sont
bien l’homologue l’une de l’autre.
Ici, il s’agit de séquences très bien conservées. Les alignements ne sont pas tjs aussi
bons.
3- De la même manière, comparez les séquences d'ADNc : quelles sont vos conclusions ?
23.6% d’identité => mauvais (avec des séquences ADN, de façon aléatoire, 4 bases donc
25% identité attendu) En fait les identités sont « concentrées » sur une zone
Pas de notion de similarité sur ADN.
Ici, c’est le début et la fin de la séquence de souris qui ne s’alignent pas à la séquence
humaine, le « milieu » s’aligne. Toujours parce que sur la séquence humaine on n’a que
l’ORF !!
Avant et après il y a les UTRs sur la séquence de souris et donc rien sur la séquence
humaine (donc ----)
L’alignement commence à ATG et finit au Stop : on voit le codon TAA sur humain, TGA
sur souris.
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
Alignement moins bon que celui avec les protéines : pourquoi ? (NB : si on se limite à la
partie ORF on a 84% id, alors que 92% avec les protéines)
C’est la dégénérescence du code génétique : pour le même acide aminé ce n’est pas
forcément le même codon sur la séquence de souris et humaine. En général, c’est la 3e
base des codons qui change (wobble), c’est pour ça que dans l’alignement on voit :
THAP1_humaine 569 AAGACGACGTATCAGAAAGAGGTTATGTGATTCTACCAAATGACTACTTT 618
|.|||||||..||.||.||.||.||.|||||.||||||||||||||||||
THAP1_souris 842 AGGACGACGCGTCCGAGAGGGGCTACGTGATCCTACCAAATGACTACTTT 891
C’est typique d’un alignement de séquences codantes chez 2 organismes différents : des
substitutions sur la 3e lettre des codons
On a 3 fois --- : insertion/délétion qui correspondent aux 3 AA en moins sur la protéine
de souris
Ici, même au niveau ADN, les séquences sont très bien conservées.
Conclusions :
Quand on compare des séquences codantes de protéines, on travaille au niveau
protéique :
- pas le problème des UTRs (ici on avait les UTRs que pour la souris, mais les
UTRs ne seraient pas bien conservées)
- pas les substitutions liées à la dégénérescence du code
- notion de similarité entre acides aminés qui s’ajoute (surtout important quand
on compare des séquences moins bien conservées, comme homme/ver de terre...)
IV- Amplification par PCR et clonage
Vous voulez maintenant amplifier par PCR la séquence codante de l'ARNm de THAP1
murine, puis la cloner dans un vecteur.
1- A partir de la séquence de l'ARNm NM_199042.2, faites une recherche d’amorces PCR
avec le programme Primer3
Pour amplifier la zone souhaitée, vous pourrez mettre comme paramètres :
Targets : 283,1 915,1
Excluded Regions : 280,650
N'hésitez pas à regarder aussi les autres paramètres !
Targets : 283,1 915,1 : permet de définir la zone vers laquelle on veut les oligos
donc ici la position de l’ORF
Excluded regions : pour exclure une zone sur laquelle on ne veut pas qu’il propose les
oligos => ici l’ORF (en arrondissant) puisqu’on veut l’amplifier entièrement
(le paramétrage c’est position_début, longueur_de_la_zone)
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
Les autres paramètres : longueurs des oligos, %GC, Tm, risque d’autocomplémentarité,
risque d’hybridation des 2 oligos, concentrations, etc…
=> ce sont des paramètres liés au bon fonctionnement de la PCR.
A priori, ils sont bien définis, le programme va se « débrouiller » pour trouver le meilleur
couple d’oligos. On ne les touche pas. Si le programme répond qu’il n’arrive pas à faire
des primers, alors on peut les modifier, mais attention, le succès de la PCR en dépend.
Ce sont surtout les positions des oligos, longueur de la zone à amplifier, etc qu’il est
important de préciser.
Notez les positions des oligonucléotides.
Expliquer le résultat de Primer3 : un couple d’oligos proposé en haut avec position,
longueur, %GC, Tm…
OLIGO start len tm gc% any 3' seq
LEFT PRIMER 262 18 59.75 61.11 4.00 2.00 GAAGTGTGGAGGGCCAGA
RIGHT PRIMER 957 26 59.90 42.31 4.00 1.00 AAGAAGGTGTATAGTCTTGTCCCACT
Pourquoi les 2 oligos n’ont pas la même taille ?
Le but est qu’ils aient le même Tm pour la PCR ! Donc le programme a cherché des oligos
dans la zone définie et il teste et calcule le Tm jusqu’à trouver 2 oligos avec le même Tm
Ensuite on voit la séquence avec >>> oligo gauche, <<< oligo droit, et XXXX la zone
exclue= ORF
En bas, d’autres couples d’oligos sont proposés.
Pour le clonage dans un vecteur, vous devez établir la carte de restriction de la séquence et
trouver des sites de restriction uniques, aux extrémités du produit PCR.
2- Vous devez d'abord extraire le fragment amplifié par PCR : utiliser extractseq (rubrique
Edit) de la suite EMBOSS.
Dans ExtracSeq, on colle la séquence d’ADNc de souris
en dessous : Regions to extract : 262-957
On récupère la sous-séquence extraite
3- Puis faites la digestion du produit PCR avec Web Map Preferences. (Cliquez sur )
Trouvez-vous des enzymes qui permettraient de cloner toute la séquence codante ?
Ce qu’on cherche : 2 sites de restriction à bouts sortants (extrémités cohésives) pour
faire un clonage orienté. 1 site qui soit avant l’ORF, et 1 qui soit après. Il faut que les
enzymes ne coupent pas ailleurs => on pourra regarder les sites Uniques qui seront en
rouge
Downloaded by Imen Rekik (imenbmc1@[Link])
lOMoARcPSD|33465914
Web Map Preference a fait une recherche d’ORF => il affiche la protéine en vert.
A gauche : BstX1, mais pas de site à droite de l’ORF !
Quelle(s) solution(s) pouvez-vous proposer ?
1- On peut chercher 1 autre couple d’oligos pour la PCR, qui étendrait la séquence à
droite, et espérer trouver un site de restriction sur cette zone.
2- On peut faire une PCR à queue flottante, c'est-à -dire rajouter les sites de
restrictions aux oligos => on aura les sites dans le produit PCR.
Les sites qu’on va rajouter ne doivent pas être sur la séquence (Web Map Preference
sort la liste des sites non trouvés en bas de la page, Not found), mais doivent être
présents sur le site MCS du plasmide qu’on va utiliser.
Le reste ne présente pas trop d’intérêt à faire par ordinateur : il faut repasser à la
paillasse.
Faire une carte de restriction (avec ce programme ou un autre) est un outil de base en
bio mol pour préparer un clonage, ou avant de faire un gel…
NB : en bas de la page du TP, vous avez les liens sauvegardés des principaux
résultats
Principaux résultats :
Blastn avec la sonde contre les séquences de souris
Recherche d'ORF avec sixpack sur NM_199042.2
Recherche d'ORF avec ORF finder sur NM_199042.2
Alignement des protéines avec needle
Alignement des ADNc avec needle
Résultat de Primer3
Résultat de Web Map Preferences
Downloaded by Imen Rekik (imenbmc1@[Link])