0% encontró este documento útil (0 votos)
6 vistas7 páginas

TP Bioinformática

La guía de estudio sobre Bioinformática en Biología Molecular tiene como objetivos enseñar el uso de herramientas bioinformáticas para el análisis de ácidos nucleicos y proteínas, así como su aplicación en la investigación biológica. Se describen recursos en línea, formatos de secuencias y métodos de comparación, destacando el programa BLAST para el alineamiento de secuencias. Además, se incluyen ejercicios prácticos para familiarizarse con los servidores y el análisis de secuencias.

Cargado por

Alejandra Fadon
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
6 vistas7 páginas

TP Bioinformática

La guía de estudio sobre Bioinformática en Biología Molecular tiene como objetivos enseñar el uso de herramientas bioinformáticas para el análisis de ácidos nucleicos y proteínas, así como su aplicación en la investigación biológica. Se describen recursos en línea, formatos de secuencias y métodos de comparación, destacando el programa BLAST para el alineamiento de secuencias. Además, se incluyen ejercicios prácticos para familiarizarse con los servidores y el análisis de secuencias.

Cargado por

Alejandra Fadon
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Guía de estudio Biología Molecular-Cátedra de Química Biológica-FCN-UNSa

TRABAJO PRÁCTICO

Bioinformática

Objetivos:
 Conocer las herramientas bioinformáticas disponibles en internet.
 Aprender a utilizar las herramientas bioinformáticas.
 Proporcionar una herramienta útil para el análisis de ácidos nucleicos y
proteínas.
 Utilizar la bioinformática como herramienta metodológica para dar respuesta a
preguntas de importancia para la sociedad

Introducción

La Bioinformática es la aplicación de herramientas computacionales para


organizar, analizar, comprender, visualizar y almacenar información asociada
con datos biológicos. Es un área de investigación interdisciplinaria, es decir una
interfaz entre las ciencias biológicas y las computacionales.
La bioinformática utiliza algoritmos, bases de datos y sistemas de
información, tecnologías web, inteligencia artificial, procesamiento de imágenes,
modelado y simulación, y estadísticas, todo esto con asistencia de computadoras
con el fin de recopilar, almacenar, analizar y combinar datos biológicos para
facilitar su gestión y análisis.
El objetivo de la bioinformática es descubrir la riqueza de la información
biológica escondida dentro de una gran masa de datos.

I. Recursos disponibles en internet para el análisis de secuencias


de ácidos nucleicos y proteínas

1) Servidores de institutos de bioinformática: Permiten usar una serie de


herramientas en línea. Los más importantes son:

- NCBI Nacional Center for Biotechnology Information, situado en EEUU:


[Link]

- EBI European Bioinformatics Institute, es la rama británica del EMBL, European


Molecular Biology Laboratory, que es también una base de datos:
[Link]

- Genomenet, situado en el centro de Bioinformática de la Universidad de Kyoto, Japón:


[Link]

Todos los servidores están asociados a bases de datos de secuencias de ácidos


nucleicos y proteínas, y tienen programas que permiten comparar una secuencia
incógnita con las bases de datos, realizar comparaciones mediante alineamientos de
proteínas, buscar motivos conservados, etc.
La elección del servidor a utilizar depende del tipo de herramientas que uno prefiera. En
general existen diferencias entre las maneras de ingresar los datos y de mostrar los
resultados entre los servidores, que a su vez van actualizando sus posibilidades.

2) Bases de datos
1
Guía de estudio Biología Molecular-Cátedra de Química Biológica-FCN-UNSa

Existen bases de datos de secuencias nucleotídicas y bases de datos de


proteínas generales, que contienen todas las secuencias públicas, y existen bases de
datos más específicas, por ejemplo, bases de datos que contienen sólo información
relacionada a enfermedades humanas, o a genomas enteros, etc.
Las bases de datos de secuencias nucleotídicas: EMBL, GenBank (NCBI) y
DDBJ (Japón) intercambian información permanentemente, por lo que contienen
esencialmente la misma.

II. Formato de las secuencias de nucleótidos


Existen varias formas de guardar las secuencias en un fichero de texto:
a. texto plano: si sólo queremos guardar la secuencia se puede crear un
fichero se texto y simplemente escribir la secuencia. Esto se conoce
como secuencia en texto plano.
Ejemplo:
ACAAGATGCCATTGTCCCCCGGCCTCCTGCTGCTGCTGCTCTCCGGGGCCACGG
CCACCGCTGCCCTGCCCCTGGAGGGTGGCCCCACCGGCCGAGACAGCGAGCAT
ATGCAGGAAGCGGCAGGAATAAGGAAAAGCAGCCTCCTGACTTTCCTCGCTTGGT
GGTTTGAGTGGACCTCCCAGGCCAGTGCCGGGCCCCTCATAGGAGAGGAAGCTC
GGGAGGTGGCCAGGCGGCAGGAAGGCGCACCCCCCCAGCAATCCGCGCGCCG
GGACAGAATGCCCTGCAGGAACTTCTTCTGGAAGACCTTCTCCTCCTGCAAATAA
AACCTCACCCATGAATGTCACGC

Este formato tiene algunas limitaciones, no puede haber más que una secuencia dentro
del fichero y no puede incluirse el nombre de la secuencia dentro del fichero.

b. Formato Fasta: la secuencia comienza con el signo “>”, seguido del


nombre de la secuencia (sequence ID) y luego puede o no contener una
descripción. A continuación, sigue la secuencia propiamente dicha con el
formato en texto plano. Pueden incluirse varias secuencias en un mismo
fichero (multi fasta format).

Ejemplo:

>nombre_secuencia1 descripción
ACAAGATGCCATTGTCCCCCGGCCTCCTGCTGCTGCTGCTCTCCGGGGCCACGG
CCACCGCTGCCCTGCCCCTGGAGGGTGGCCCCACCGGCCGAGACAGCGAGCAT
ATGCAGGAAGCGGCAGGAATAAGGAAAAGCAGCTCCTGACTTTCCTCGCTTGGTG
GTTTGAGTGGACCTCCCAGGCCAGTGCCGGGCCCCTCATAGGA
GAGGAAGCTCGGGAGGTGGCCAGGCGGCAGGAAGGCGCACCCCCCCAGCAATC
CGCGCGCCGGGACAGAATGCCCTGCAGGAACTTCTTCTGGAAGACCTTCTCCTC
CTGCAAATAAAACCTCACCCATGAATGCTCACGC

>nombre_secuencia2 descripción
ACAAGATGCCATTGTCCCCCGGCCTCCTGCTGCTGCTGCTCTCCGGGGCCACGG
CCACCGCTGCCCTGC
CCCTGGAGGGTGGCCCCACCGGCCGAGACAGCGAGCATATGCAGGAAGCGGCA
GGA

Una secuencia puede tener más atributos. Podemos querer incluir el nombre del
investigador que la secuenció o un identificador para una base de datos.

c. Secuencia en formato embl:

2
Guía de estudio Biología Molecular-Cátedra de Química Biológica-FCN-UNSa

d. Secuencia en formato GenBank:

El formato más utilizado contiene la información en diferentes líneas, seguidas por la


secuencia. En la tabla se indica la abreviatura del tipo de información a la izquierda, y
una descripción de la información de cada línea a la derecha.
ID Identidad de la secuencia, tipo, organismo y largo

3
Guía de estudio Biología Molecular-Cátedra de Química Biológica-FCN-UNSa

AC Número de acceso
DT Fechas de ingreso y modificaciones
DE Descripción de la secuencia
KW Palabras claves
OS, OC Organismo, características taxonómicas
RN Referencias en Medline (Números de entrada de PubMed)
DR Conexiones a secuencias de proteínas en SwissProt
CC Comentarios
FT Tabla de características: cada característica presente dentro de la
Secuencia puede ser obtenida separadamente como una
“pseudo-entrada”, estas incluyen:
Fuente
Secuencia codificante (CDS)
Características misceláneas
Regiones repetitivas
SQ Secuencia, comenzando con su composición

III. Búsquedas de similitud


Una vez que se cuenta con una secuencia correspondiente al gen (o región) de
interés, el primer análisis que se debe realizar es verificar si ya ha sido secuenciado
previamente, y en caso contrario, si es similar a otras secuencias ya descriptas.
Las secuencias no son demasiado informativas per se, deben ser analizadas por
comparación con secuencias previamente depositadas en bancos de datos, cuya
función y/o estructura ya han sido determinadas, para poder así elaborar hipótesis con
respecto de las características del producto de la secuencia incógnita.
Para realizar este análisis se utilizan programas especiales. Los programas que
comparan secuencias asumen que todas las secuencias similares son homólogas entre
si, es decir, que tienen un origen común. La palabra homología significa la existencia de
un antecesor común, y no se refiere al grado de similitud que comparten dos secuencias
entre sí. Para indicar esto, se habla de identidad (porcentaje de residuos idénticos en
ambas secuencias) o de similitud (suma del porcentaje de residuos idénticos más el de
residuos similares, es decir, del mismo tipo, por ejemplo, aminoácidos aromáticos, o
ácidos, etc.)
Las secuencias homólogas, es decir, aquellas que provienen de una misma
secuencia ancestral, pueden ser parálogas, cuando se originan por duplicación génica,
pudiendo estar presentes en el genoma del mismo organismo y poseer diferente función,
u ortólogas, cuando no ocurrió duplicación del gen ancestral. Las secuencias ortólogas
presentes en especies diferentes son similares, tengan o no funciones relacionadas. Por
último, un gen puede haberse adquirido por transferencia lateral de un organismo a otro,
y en este caso se habla de genes xenólogos.

Alineamiento de secuencias: Programa BLAST


Blast (Basic Local Alignment Search Tools) es el programa más utilizado para la
comparación de secuencias. Es uno de los programas de búsqueda de similitud entre
secuencias más rápido y no requiere un soporte informático especial. Además, se
encuentra disponible en numerosos servidores. Permite comparar entre sí secuencias
de nucleótidos o de aminoácidos.
Utiliza una serie de algoritmos para comparar una secuencia incógnita con todas
las secuencias presentes en una base de datos seleccionada. Las comparaciones se
realizan por pares. A cada una se le asigna un puntaje o score que refleja el grado de
similitud entre la secuencia incógnita y la secuencia utilizada en la comparación. A
mayor score, mayor es el grado de similitud. La similitud se mide y se muestra mediante
el alineamiento entre dos secuencias. Este alineamiento puede ser local o global
(dependiendo del tipo de algoritmo que se utilice). Un alineamiento global es un

4
Guía de estudio Biología Molecular-Cátedra de Química Biológica-FCN-UNSa

alineamiento óptimo (el alineamiento con el que se obtiene el máximo score posible)
que incluye todos los caracteres de cada secuencia, mientras que un alineamiento local
es un alineamiento óptimo que incluye únicamente la/las región/es más similar/es. El
programa BLAST se basa en alineamientos locales. Existe la posibilidad de que los
apareamientos no sean reales, sino producto del azar. Para discriminar entre ambos se
utiliza una estimación de la probabilidad de que ocurra un apareamiento al azar. La
similitud por sí misma no puede considerarse un indicador de una función determinada
(a veces un cambio en un único residuo cambia la función).

Significación
La significación de cada alineamiento está representada por el valor P o valor E
(E value). Es preciso controlar cada alineamiento manualmente para verificar su validez.
Por ejemplo, pares de secuencias con un alto score cuya similitud se base en
extensiones de aminoácidos repetidos normalmente no reflejan una similitud
significativa entre la secuencia incógnita y la secuencia apareada. Existen filtros que
pueden ayudar a disminuir este problema, como por ejemplo aquellos que enmascaran
regiones de baja complejidad (repeticiones)
Valor E: Expectation value. Número de alineamientos diferentes con scores
iguales o mejores a S que se espera que ocurran por azar en la base de datos. A menor
valor de E, mayor significación del score.
Valor P: Probabilidad de que ocurra un alineamiento con el score reportado o
mejor. Este valor se calcula relacionando el score observado, S, con la distribución
esperada de pares con alto score (HSP) obtenida mediante la comparación de
secuencias que tienen el mismo largo y composición de la secuencia incógnita
generadas al azar con la base de datos. Los valores de P de mayor significatividad son
los más cercanos a cero.

Opciones del programa BLAST


El programa BLAST tiene diferentes opciones que permiten realizar diferentes
tipos de comparaciones, que se describen a continuación:

Programa Descripción

Blastp Compara una secuencia incógnita de aminoácidos contra la base de


datos de proteínas.

Blastn Compara una secuencia incógnita de nucleótidos contra la base de


datos de ácidos nucleicos.

Blastx Compara una secuencia incógnita de nucleótidos traducida en todos


los marcos de lectura contra la base de datos de proteínas. Se puede
usar esta opción para encontrar probables productos de traducción
de una nueva secuencia nucleotídica.
Tblastn Compara una secuencia incógnita de aminoácidos contra la base de
datos de ácidos nucleicos traducida en todos los marcos de lectura
Tblastx Compara una secuencia incógnita de nucleótidos traducida en todos
los marcos de lectura contra la base de datos de ácidos nucleicos
traducida en todos los marcos de lectura. No se puede utilizar con la
base de datos completa en línea debido a que el uso de recursos
necesario es demasiado grande

Actividades

5
Guía de estudio Biología Molecular-Cátedra de Química Biológica-FCN-UNSa

Ejercicio 1
Ingrese a los siguientes servidores: [Link] [Link]
[Link] Observe como está estructurada y organizada cada página y
compare cada una.

Ejercicio 2:
Dada la siguiente secuencia responda
a. ¿En qué formato se encuentra?
b. Analícela utilizando el programa BLAST
([Link] y señale a que organismo
pertenece? ¿Para qué puede utilizarse esta información?

>M27039.1 Acyrthosiphon symbiont P 16S ribosomal RNA gene sequence


AAATTGAAGAGTTTGATCATGGCTCAGATTGAACGCTGGCGGCAAGCCTAACACATGCAAGTCGAGCGGC
AGCGAGAAGAGAGCTTGCTCTCTTTGTCGGCAAGCGGCAAACGGGTGAGTAATATCTGGGGATCTACCCA
AAAGAGGGGGATAACTACTAGAAATGGTAGCTAATACCGCATAATGTTGAAAAACCAAAGTGGGGGACCT
TTTGGCCTCATGCTTTTGGATGAACCCAGACGAGATTAGCTTGTTGGTAGAGTAATAGCCTACCAAGGCA
ACGATCTCTAGCTGGTCTGAGAGGATAACCAGCCACACTGGAACTGAGACACGGTCCAGACTCCTACGGG
AGGCAGCAGTGGGGAATATTGCACAATGGGCGAAAGCCTGATGCAGCTATGCCGCGTGTATGAAGAAGGC
CTTAGGGTTGTAAAGTACTTTCAGCGGGGAGGAAAAAAATAAAACTAATAATTTTATTTCGTGACGTTAC
CCGCAGAAGAAGCACCGGCTAACTCCGTGCCAGCAGCCGCGGTAATACGGAGGGTGCAAGCGTTAATCAG
AATTACTGGGCGTAAAGAGCGCGTAGGTGGTTTTTTAAGTCAGGTGTGAAATCCCTAGGCTCAACCTAGG
AACTGCATTTGAAACTGGAAAACTAGAGTTTCGTAGAGGGAGGTAGAATTCTAGGTGTAGCGGTGAAATG
CGTAGATATCTGGAGGAATACCCGTGGCGAAAGCGGCCTCCTAAACGAAAACTGACACTGAGGCGCGAAA
GCGTGGGGAGCAAACAGGATTAGATACCCTGGTAGTCCATGCCGTAAACGATGTCGACTTGGAGGTTGTT
TCCAAGAGAAGTGACTTCCGAAGCTAACGCATTAAGTCGACCGCCTGGGGAGTACGGCCGCAAGGCTAAA
ACTCAAATGAATTGACGGGGGCCGCACAAGCGGTGGAGCATGTGGTTTAATTCGATGCAACGCGAAAAAC
CTTACCTGGTCTTGACATCCACAGAATTCTTTAGAAATAAAGAAGTGCCTTCGGGAGCTGTGAGACAGGT
GCTGCATGGCTGTCGTCAGCTCGTGTTGTGAAATGTTGGGTTAAGTCCCGCAACGAGCGCAACCCTTATC
CCCTGTTGCCAGCGGTTCGGCCGGGAACTCAGAGGAGACTGCCGGTTATAAACCGGAGGAAGGTGGGGAC
GACGTCAAGTCATCATGGCCCTTACGACCAGGGCTACACACGTGCTACAATGGTTTATACAAAGAGAAGC
AAATCTGCAAAGACAAGCAAACCTCATAAAGTAAATCGTAGTCCGGACTGGAGTCTGCAACTCGACTCCA
CGAAGTCGGAATCGCTAGTAATCGTGGATCAGAATGCCACGGTGAATACGTTCCCGGGCCTTGTACACAC
CGCCCGTCACACCATGGGAGTGGGTTGCAAAAGAAGCAGGTATCCTAACCCTTTAAAAGGAAGGCGCTTA
CCACTTTGTGATTCATGACTGGGGTGAAGTCGTAACAAGGTAACCGTAGGGGAACCTGCGGTTGGATCAC
CTCCTTA

c. Veamos ahora qué pasa cuando usamos sólo fragmentos de nuestra


secuencia problema: Realice nuevas búsquedas usando 1/2 de la secuencia
problema y para 1/4 de la secuencia original. Compare los gráficos obtenidos.
¿Qué conclusiones puede obtener?
d. Diseñe cebadores (primers) con alguna herramienta de las páginas visitadas.

Ejercicio 3:
El estudio de la evolución molecular de los organismos puede realizarse a partir de la
construcción y análisis de árboles filogenéticos. Con el advenimiento de las técnicas de
secuenciación masiva, su abaratamiento progresivo y la mayor distribución de
plataformas a nivel mundial, en los últimos años se incrementó sustancialmente la
cantidad de secuencias genómicas disponibles en las bases de datos. Estos avances
también han impulsado el desarrollo e implementación de herramientas que permiten el
análisis eficiente de conjuntos de secuencias (datasets), tanto de tamaños pequeños o
moderados (menor a 100 secuencias) como grandes (cientos o miles de secuencias).
Desde los primeros informes de la neumonía nueva, COVID-19 que surgió en Wuhan,
provincia de Hubei, China, ha habido una discusión considerable sobre el origen del
virus causante, SARS-CoV-2. El SARS-CoV-2 es el séptimo coronavirus que se sabe
que infecta a los seres humanos: el SARS-CoV, MERS-CoV y el SARS-CoV-2 pueden
causar una enfermedad grave, mientras que HKU1, NL63, OC43 y 229E se asocian con

6
Guía de estudio Biología Molecular-Cátedra de Química Biológica-FCN-UNSa

síntomas leves. A partir del análisis comparativo de datos genómicos, analizaremos que
se puede deducir sobre el origen del SARS-CoV-2 (Andersen et al, 2020)

1) Ingrese al [Link] realice la búsqueda de las siguientes


secuencias: MN908947, MN996532, AY278741, KY417146 y MK211376; y
analice la información que se brinda: base de datos en la que está publicado, a
qué organismo pertenece, año de publicación, método por el cual se obtuvo, etc.
2) Se ha visto que el dominio de unión a receptores (RBD) en la proteína “spike” es
la parte más variable del genoma de los coronavirus. Seis aminoácidos de este
dominio RBD han demostrado ser críticos para vincularse a receptores ACE2
(enzima convertidora de angiotensina 2) en humanos, y para determinar la
variedad de hospedantes de virus similares al SARS-CoV7. Teniendo en cuenta
este antecedente, la proteína spike es la mejor candidata para analizar cómo es
que el SARS-CoV-2 llegó a los humanos, con base en la filogenia.
a) Descargue el archivo [Link] provisto por la cátedra. En él se
encuentran las secuencias de proteínas spike obtenidas de los coronavirus
de cinco organismos: humanos (coronavirus causantes del SARS-CoV2
humano, SARS, MERS), coronavirus de murciélagos y coronavirus de
pangolín.
b) En la página [Link] cargue el archivo
fasta y analice el resultado. Nota: para ello deberá cargar su correo
electrónico para recibir el resultado.
c) ¿Qué conclusión puede obtener de estos resultados? ¿Que nos dice esta
comparación acerca del origen del coronavirus causante del COVID_19?

Bibliografía

- Andersen, K.G., Rambaut, A., Lipkin, W.I. et al. The proximal origin of SARS-CoV-2.
Nat Med 26, 450–452 (2020). [Link]
- Baxevanis, A. D., Bader, G. D., & Wishart, D. S. (Eds.). (2020). Bioinformatics. John
Wiley & Sons.
- Dereeper A., Guignon V., Blanc G., Audic S., Buffet S., Chevenet F., Dufayard J.F.,
Guindon S., Lefort V., Lescot M., Claverie J.M., Gascuel O. [Link]: robust
phylogenetic analysis for the non-specialist. Nucleic Acids Res. 2008 Jul 1;36(Web
Server issue): W465-9. Epub 2008 Apr 19. (PubMed).
-. Herramientas informáticas para el análisis estructural de ácidos nucleicos y proteínas.
Guía de Curso Teórico-Practico de Postgrado. Año 2009. Departamento de Química
Biológica, Facultad de Ciencias Naturales y Exacta, Universidad Nacional de Buenos
Aires.
-. Nunzio D'Agostino, Alessandra Traini, Luigi Frusciante and Maria Luisa Chiusano.
SolEST database: a "one-stop shop" approach to the study of Solanaceae
transcriptomes. BMC Plant Biology.2009.
-. Rech, Gabriel E. (2010). Programa Teórico-Práctico de Bioinformática y Genómica
Computacional. Universidad de Salamanca, España. Fundación CAPACIT-AR DEL
NOA, Salta, Argentina. Availabe at:
[Link]
- Torres y Blanco Fernández. Filogenias Moleculares. Guía para Actividades. Curso:
Introduccióna la Bioniformatica y Ciencia de Datos. 20019. Uruguay.

También podría gustarte