0% encontró este documento útil (0 votos)
0 vistas15 páginas

2

El documento describe la importancia de las bases de datos biológicas en la bioinformática, enfocándose en NCBI, UniProt, InterPro y PDB para el análisis de la proteína Amuc_1100 de Akkermansia muciniphila. Se detallan los objetivos de aprendizaje y el flujo de trabajo para acceder a información sobre secuencias, funciones y estructuras de proteínas. La práctica resalta la relevancia de estas herramientas para la investigación biotecnológica y la comprensión de procesos biológicos a nivel molecular.

Cargado por

lo361578
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
0 vistas15 páginas

2

El documento describe la importancia de las bases de datos biológicas en la bioinformática, enfocándose en NCBI, UniProt, InterPro y PDB para el análisis de la proteína Amuc_1100 de Akkermansia muciniphila. Se detallan los objetivos de aprendizaje y el flujo de trabajo para acceder a información sobre secuencias, funciones y estructuras de proteínas. La práctica resalta la relevancia de estas herramientas para la investigación biotecnológica y la comprensión de procesos biológicos a nivel molecular.

Cargado por

lo361578
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Universidad Autónoma del Estado de Hidalgo

Instituto de Ciencias Agropecuarias


Práctica 2 Uso de bases de datos.

Cisneros Reyes Daniel


Lopez Monrroy Alam Ocelotl

GENÓMICA Y BIOINFORMÁTICA

Enero-Junio 2026
Introducción
En la era de la biología molecular y la genómica, la cantidad de información
generada es masiva y diversa. En respuesta a esta complejidad, las bases de
datos biológicas surgieron como herramientas fundamentales para almacenar,
estructurar, organizar y manipular datos biológicos. Estas plataformas
proporcionan acceso a secuencias de ADN, proteínas, estructuras
tridimensionales y anotaciones funcionales, entre otros datos relevantes,
permitiendo a los investigadores navegar por el vasto universo de la información
genética y proteica (Baxevanis & Bateman, 2020).
En esta práctica, se explorarán cuatro bases de datos clave que representan
pilares fundamentales en la bioinformática moderna:
NCBI (National Center for Biotechnology Information): Un recurso integral que
alberga una amplia variedad de bases de datos interconectadas. Incluye GenBank
para secuencias de ADN, PubMed para literatura científica, y numerosas
herramientas para el análisis bioinformático, consolidándose como un punto de
partida esencial para cualquier investigación (Sayers et al., 2022).
UniProt: Considerada la base de datos de proteínas más completa y actualizada,
contiene información detallada sobre la función y estructura de proteínas
conocidas y predichas, actuando como un "expediente" centralizado para el
estudio de cualquier proteína (The UniProt Consortium, 2023).
InterPro: Una base de datos especializada que integra información de diversos
recursos para identificar dominios proteicos, familias y sitios de unión. Su enfoque
en la clasificación permite caracterizar funcionalmente una secuencia a través de
su arquitectura de dominios (Paysan-Lafosse et al., 2023).
PDB (Protein Data Bank): El depósito mundial de estructuras tridimensionales de
proteínas y ácidos nucleicos. Proporciona información valiosa para estudiar la
función, las interacciones moleculares y el diseño racional de proteínas,
acercándonos a la comprensión de la maquinaria de la vida a nivel atómico
(wwPDB Consortium, 2019).
Estas bases de datos son de gran importancia para la investigación biotecnológica
y biomédica actual. Sin embargo, constituyen solo una muestra representativa, ya
que existen muchas otras bases de datos o servidores especializados que pueden
consultarse dependiendo de los objetivos específicos de cada estudio (Baxevanis
& Bateman, 2020). El dominio de estas herramientas es hoy en día una
competencia indispensable para cualquier científico que busque explorar los
mecanismos moleculares de la vida.
Objetivo General
Al término de la práctica el alumno obtendrá conocimientos sobre el uso de las
bases de datos como NCBI, UniProt, InterPro y PDB para analizar e interpretar
información relevante de secuencias de ADN y proteína y sus estructuras
tridimensionales.
Objetivos Específicos
1.- El alumno comprenderá la importancia y utilidad de las bases de datos y
adquirirá habilidades prácticas para navegar y utilizar eficientemente estas
herramientas.
2.- El alumno utilizará NCBI para buscar y recuperar secuencias de ADN y
proteínas.
3.- El alumno aprenderá a utilizar UniProt para acceder a información funcional de
proteínas, incluyendo dominios, funciones biológicas, anotaciones de sitios de
unión y otras características de proteínas.
4.- El alumno empleará InterPro para identificar dominios y familias proteicas
presentes en las secuencias de proteínas a analizar.
5.- El alumno usará PDB para acceder a estructuras tridimensionales de proteínas
Justificación:
La bacteria intestinal Akkermansia muciniphila ha emergido como un
microorganismo clave en la regulación de la homeostasis intestinal y metabólica,
principalmente por su capacidad de degradar mucina y modular la respuesta
inmune del huésped. Entre sus componentes más estudiados se encuentra la
proteína de membrana externa Amuc_1100, la cual ha demostrado efectos
directos sobre la integridad de la barrera intestinal y la modulación de vías
inmunológicas a través de la interacción con receptores como TLR2.
Por otro lado, los exopolisacáridos (EPS) producidos por A. muciniphila
representan otra clase de moléculas bioactivas con potencial probiótico y
postbiótico, capaces de influir en la respuesta inmune y en la estabilidad del
microbioma. Sin embargo, la relación funcional entre Amuc_1100 y los EPS aún
no está completamente caracterizada.

Para llevar a cabo esta practica se utilizaron algunas bases de datos como NCBI,
UniPro, InterPro y PDB. Se inicio en la base de datos NCBI en la cual a primera
instancia podemos observar el inicio de la base de datos en la cual seleccionamos
la base de datos de proteínas, tecleamos la proteína de interés y buscar.
Fig.1 Base de datos NCBI

Fig.2 Amuc 1100 de Akkermansia Muciniphilla

Una vez que se buscó la proteína de interés lo seleccionamos para poder


encontrar la secuencia de nucleótidos
Fig.3 Información de interés​

Posteriormente para obtener el formato fasta del gen se selecciono el la parte


superior de la base de datos en el apartado “Send to” se selecciono el apartado
“file” , posteriormente en “FASTA” y por ultimo en “Create file”.

Fig. 4 Descarga en formato FASTA.


Fig.5 Proteína en formato FASTA descargado

Cuando entramos en la base de datos de UniPro nos encontramos con la página


de inicio y en el buscador colocamos el nombre de la proteína deseada

Fig.6 Pagina inicial de UniPro.

Posteriormente dimos clic en el ID de entrada para obtener toda la informacion


relacionada con Amuc_1100 de Akkermancia muciniphilla.
Fig.7 tabla de contenidos relacionados de Amuc_1100 de A. muciniphila.

Fig.8 Información de Amuc_1100

Dentro de la base de datos de UniPro podemos encontrar información de interés y


detallada de Amuc_1100 como el nombre de la proteina, nombre de los genes, el
organismo de donde proviene, su forma estructural y su secuencia.
Fig.9 Estructura de Amuc_1100.

Fig.10 Secuencia de Amuc_1100.

En la base de datos de InterPro cargamos el formato FASTA desgarbado


previamente del NCBI de Amuc_1100
Fig.11 Página de inicio de InterPro

Fig. 12 Carga de formato fasta de Amuc_1100


Fig. 13 Resultados de carga de Amuc_1100

Amuc_1100 al no ser una proteína caracterizada aun InterPro arroja muy pocos
resultados acerca de esta en la cual menciona que Amuc_1100 es similar a un
pilus, al no ser una proteína tan estudiada no se cuenta con tanta información para
realizar un análisis detallado de la proteina en esta base de datos.

Fig.14 pfam de Amuc_1100


En Protein Data Bank se muestra la página de inicio de esta base de datos en la
cual realizamos la busqueda de la proteína por el PBD ID

Fig.15 página principal del PDB

Fig.16 nombre de identificación de la proteína de interés Amuc_1100 de


Akkermansia Muciniphila

Posteriormente se busco el Hit que coincide con la búsqueda y se accedió para


poder visualizar la información y el resumen relacionado con la proteína y de igual
manera su estructura 3D de la misma
Fig.17 Hits coincidentes con la búsqueda

Fig.18 Resumen de la proteína


Fig.18 estructura tridimensional de la proteína

Conclusión
La realización de esta práctica permitió comprender, de manera aplicada, la
relevancia y el funcionamiento de las principales bases de datos biológicas
utilizadas en la bioinformática estructural y funcional. A través del estudio de la
proteína Amuc_1100 de Akkermansia muciniphila, fue posible recorrer un flujo de
trabajo completo que inició con la búsqueda de secuencias en NCBI, continuó con
el análisis de información funcional en UniProt, la exploración de dominios en
InterPro y finalizó con la visualización estructural en PDB.
El uso de NCBI permitió recuperar la secuencia en formato FASTA, un insumo
básico para cualquier análisis posterior. En UniProt, se corroboró la utilidad de
esta base como un "centro de conocimiento" que integra información funcional,
estructural y bibliográfica de una proteína específica, destacando la importancia de
contar con datos curados y actualizados. Por su parte, InterPro evidenció que,
aunque Amuc_1100 no es una proteína ampliamente caracterizada, es posible
obtener aproximaciones sobre su naturaleza (como su similitud con proteínas de
tipo pilus), lo que demuestra la utilidad de las bases de datos de clasificación para
formular hipótesis sobre proteínas poco estudiadas.

Finalmente, el uso del PDB permitió acceder a la estructura tridimensional


experimental de Amuc_1100 (código 6KNY), lo que facilitó la comprensión de su
conformación espacial y la relación con su posible función biológica. Esto refuerza
la idea de que la estructura de una proteína es clave para entender su mecanismo
de acción, especialmente en el contexto de la interacción bacteria-huésped.
En conjunto, esta práctica demuestra que el dominio de estas herramientas no
solo es fundamental para la investigación biotecnológica actual, sino que también
constituye una competencia esencial para cualquier profesional que busque
explorar las bases moleculares de los procesos biológicos. La integración de la
información obtenida desde distintas perspectivas (secuencia, función,
clasificación y estructura) permite construir un panorama más completo y sólido
sobre cualquier molécula de interés.
Cuestionario
1. ¿Qué es el formato FASTA y su estructura?
Es un formato de texto simple para representar secuencias biológicas (ADN o
proteínas).Estructura: 1) Una línea de cabecera que comienza con ">" seguida del
identificador y descripción de la secuencia. 2) Una o más líneas con la secuencia
en código de una letra.
2. ¿Qué bases de datos nutren a UniProt?
UniProt se nutre principalmente de: Bases de datos primarias de secuencias:
EMBL-Bank, GenBank y DDBJ (de donde obtiene las secuencias traducidas).
Bases de datos especializadas: PDB (estructuras), InterPro (dominios), Gene
Ontology (funciones), Ensembl (genómica) y PubMed (literatura).
3. ¿Qué es AlphaFold y por qué es importante su inclusión en UniProt?
AlphaFold: Es un sistema de inteligencia artificial que predice la estructura 3D de
una proteína con alta precisión basándose solo en su secuencia.
Importancia en UniProt: Permite que UniProt ofrezca modelos 3D predichos para
millones de proteínas sin estructura experimental, democratizando el acceso a la
información estructural y acelerando la investigación.
4. Diferencias entre UniProt e InterPro. ¿Cuándo usar cada una?
UniProt: Es una base de datos de conocimiento. Proporciona un "expediente"
completo de una proteína específica (función, secuencia, patologías, etc.).Usar
cuando: Ya sé qué proteína busco y quiero toda la sobre ella.
InterPro: Es una base de datos de clasificación. Analiza una secuencia para
identificar familias, dominios y sitios funcionales que la componen.
Usar cuando: Tengo una secuencia desconocida y quiero saber qué tipo de
proteína es y qué partes la forman.
5. Formatos de descarga en PDB y estructura del formato PDB
Formatos de descarga: Principalmente en Formato PDB (.pdb) o PDBx/mmCIF
(.cif). También se puede descargar la secuencia en FASTA.
Estructura del formato PDB: Es un archivo de texto organizado por líneas que
comienzan con un registro.
Los registros más importantes son: HEADER (información general), SEQRES
(secuencia de aminoácidos) y ATOM (contiene las coordenadas 3D de cada átomo
de la proteína).
Referencias.
Baxevanis, A. D., & Bateman, A. (2020). The importance of biological databases in
biological discovery. En A. D. Baxevanis, G. D. Bader, & D. S. Wishart (Eds.),
Bioinformatics (4ª ed., pp. 1-18). John Wiley & Sons.
Paysan-Lafosse, T., Blum, M., Chuguransky, S., Grego, T., Pinto, B. L., Salazar, G.
A., ... & Bateman, A. (2023). InterPro in 2022. Nucleic Acids Research, *51*(D1),
D418-D427. [Link]
Sayers, E. W., Bolton, E. E., Brister, J. R., Canese, K., Chan, J., Comeau, D. C., ...
& Sherry, S. T. (2022). Database resources of the National Center for
Biotechnology Information. Nucleic Acids Research, *50*(D1), D20-D26.
[Link]
The UniProt Consortium. (2023). UniProt: The universal protein knowledgebase in
2023. Nucleic Acids Research, *51*(D1), D523-D531.
[Link]
wwPDB Consortium. (2019). Protein Data Bank: The single global archive for 3D
macromolecular structure data. Nucleic Acids Research, *47*(D1), D520-D528.
[Link]

También podría gustarte