Study Question
Below is the cDNA sequence of an unknown transcript.
CCGCGCGCAGCGGCCAGAGACCGAGCCCTAAGGAGAGTGCGGCGCTTCCCGAGGCGTGCAGCTGGGAACT
GCAACTCATCTGGGTTGTGCGCAGAAGGCTGGGGCAAGCGAGTAGAGAAGTGGAGCGTAAGCCAGGGGCG
TTGGGGGCCGTGCGGGTCGGGCGCGTGCCACGCCCGCGGGGTGAAGTCGGAGCGCGGGGCCTGCTGGAGA
GAGGAGCGCTGCGGACCGAGTAATGGCAATGCAGATGCAGCTTGAAGCAAATGCAGATACTTCAGTGGAA
GAAGAAAGCTTTGGCCCACAACCCATTTCACGGTTAGAGCAGTGTGGCATAAATGCCAACGATGTGAAGA
AATTGGAAGAAGCTGGATTCCATACTGTGGAGGCTGTTGCCTATGCGCCAAAGAAGGAGCTAATAAATAT
TAAGGGAATTAGTGAAGCCAAAGCTGATAAAATTCTGGCTGAGGCAGCTAAATTAGTTCCAATGGGTTTC
ACCACTGCAACTGAATTCCACCAAAGGCGGTCAGAGATCATACAGATTACTACTGGCTCCAAAGAGCTTG
ACAAACTACTTCAAGGTGGAATTGAGACTGGATCTATCACAGAAATGTTTGGAGAATTCCGAACTGGGAA
GACCCAGATCTGTCATACGCTAGCTGTCACCTGCCAGCTTCCCATTGACCGGGGTGGAGGTGAAGGAAAG
GCCATGTACATTGACACTGAGGGTACCTTTAGGCCAGAACGGCTGCTGGCAGTGGCTGAGAGGTATGGTC
TCTCTGGCAGTGATGTCCTGGATAATGTAGCATATGCTCGAGCGTTCAACACAGACCACCAGACCCAGCT
CCTTTATCAAGCATCAGCCATGATGGTAGAATCTAGGTATGCACTGCTTATTGTAGACAGTGCCACCGCC
CTTTACAGAACAGACTACTCGGGTCGAGGTGAGCTTTCAGCCAGGCAGATGCACTTGGCCAGGTTTCTGC
GGATGCTTCTGCGACTCGCTGATGAGTTTGGTGTAGCAGTGGTAATCACTAATCAGGTGGTAGCTCAAGT
GGATGGAGCAGCGATGTTTGCTGCTGATCCCAAAAAACCTATTGGAGGAAATATCATCGCCCATGCATCA
ACAACCAGATTGTATCTGAGGAAAGGAAGAGGGGAAACCAGAATCTGCAAAATCTACGACTCTCCCTGTC
TTCCTGAAGCTGAAGCTATGTTCGCCATTAATGCAGATGGAGTGGGAGATGCCAAAGACTGAATCATTGG
GTTTTTCCTCTGTTAAAAACCTTAAGTGCTGCAGCCTAATGAGAGTGCACTGCTCCCTGGGGTTCTCTAC
AGGCCTCTTCCTGTTGTGACTGCCAGGATAAAGCTTCCGGGAAAACAGCTATTATATCAGCTTTTCTGAT
GGTATAAACAGGAGACAGGTCAGTAGTCACAAACTGATCTAAAATGTTTATTCCTTCTGTAGTGTATTAA
TCTCTGTGTGTTTTCTTTGGTTTTGGAGGAGGGGTATGAAGTATCTTTGACATGGTGCCTTAGGAATGAC
TTGGGTTTAACAAGCTGTCTACTGGACAATCTTATGTTTCCAAGAGAACTAAAGCTGGAGAGACCTGACC
CTTCTCTCACTTCTAAATTAATGGTAAAATAAAATGCCTCAGCTATGTAGCAAAGGGAATGGGTCTGCAC
AGATTCTTTTTTTCTGTCAGTAAAACTCTCAAGCAGGTTTTTAAGTTGTCTGTCTGAATGATCTTGTGTA
AGGGTTTGGTTATGGAGTCTTGTGCCAAACCTACTAGGCCATTAGCCCTTCACCATCTACCTGCTTGGTC
TTTCATTGCTAAGACTAACTCAAGATAATCCTAGAGTCTTAAAGCATTTCAGGCCAGTGTGGTGTCTTGC
GCCTGTACTCCCAGCACTTTGGGAGGCCGAGGCAGGTGGATCGCTTGAGCCAGGAGTTTTAAGTCCAGCT
TGGCCAAGATGGTGAAATCCCATCTCTACAAAAAATGCAGAACTTAATCTGGACACACTGTTACACGTGC
CTGTAGTCCCAGCTACTCTATAGCCTGAGGTGGGAGAATCACTTAAGCCTGGAAGGTGGAAGTTGCAGTG
AGTCGAGATTGCACTGCTGCATTCCAGCCAGGGTGACAGAGTGAGACCATGTTTCAAACAAGAAACATTT
CAGAGGGCAAGTAAACAGATTTGATTGTGAGGCTTCTAATAAAGTAGTTATTAGTAGTG
Copy and paste this sequence in FASTA format into open reading frame finder program:
Do not change any parameters (default settings are OK).
[Link]
Now answer the following questions:
1. You will see an image and a table. Make sure you understand the image and the table. How
many open reading frames did the program find?
2. Can you tell which is the correct one? Why? How many amino acids does it code for?
3. Where is the 5’ and 3’ UTR? What are the sizes of UTRs and the coding sequence? Find
the start and stop codons on the cDNA sequence given above.
4. Get the correct primary sequence (aa sequence) and paste it here. You should be able to
do it *the information is there on the page
5. You want to find out the identity of this protein, so you can use use the BLAST tool.
([Link]
6. Look at the result. What do you think BLAST is used for?
7. What is the name of the protein? Write a few sentences about the function of the protein.
Where can you find that information? (Not wikipedia, of course).