Universidad Técnica de Ambato
Facultad de Ciencia e Ingeniería en Alimentos y Biotecnología
Carrera de Biotecnología
Bioinformática
Integrantes:
Espinel Ferdinand, Benítez Daniela, Jacome Karla y Toroshina Wiliam
APE 2: Análisis Bioinformático de la Evolución de especies e
identificación de Motifs.
Sexto Semestre
Ing. MSc. Fernando Galarza
14 de octubre de 2025
Paso 1. Identificación de la secuencia
Blastn realizado a la muestra problema denominada “Desconocida. fasta”
Nota. Se realizó un análisis con BLASTn en NCBI usando la secuencia en formato FASTA, excluyendo
Homo sapiens para evitar coincidencias redundantes. El resultado reveló que la secuencia corresponde al
gen BRCA1, conocido por su implicación en cáncer de mama hereditario. Este gen fue identificado por
Miki et al. en 1994 como un determinante clave en la susceptibilidad genética al cáncer de mama
(Science, 1994) y ha sido ampliamente estudiado desde entonces (Ashworth, 2024).
Paso 2. Selección de la secuencia subject y el tipo de la misma
Nota. Dado que la secuencia contenía regiones codificantes y no codificantes, se optó por trabajar con la
secuencia de aminoácidos. Para ello, se buscó el gen BRCA1 en NCBI y se descargó la isoforma 1,
considerada estándar y funcionalmente representativa. Esta conversión permite evitar interferencias de
intrones y UTRs, facilitando el análisis evolutivo. Según Ashworth (2024, Nature), las secuencias
proteicas son más conservadas entre especies y permiten una mejor detección de ortólogos funcionales .
Con la secuencia proteica en formato FASTA, se realizó un BLASTp en NCBI, nuevamente excluyendo
Homo sapiens. Se utilizó la opción Protein Select como referencia para asegurar que las secuencias
comparadas fueran de alta calidad y anotadas correctamente. Esta estrategia permite identificar ortólogos
evolutivos, es decir, genes homólogos en otras especies que conservan función.
Paso 3. Criterios para selección de homologías
Para seleccionar las secuencias homólogas, se priorizó:
Un alto porcentaje de identidad (por encima del 70%)
Una cobertura de consulta elevada (idealmente cercana al 100%)
Que las secuencias provinieran de especies distintas, para asegurar diversidad
taxonómica en el análisis filogenético.
Este enfoque está respaldado por estudios como el de Zhang et al. (2023,
Bioinformatics), quienes recomiendan usar secuencias proteicas con alta identidad y
cobertura para construir árboles filogenéticos confiables.
Tabla 1
Secuencia homologas seleccionadas
Acc. Ref Especie Puntuación total Valor E Identidad Longitud
(%) alineada
1 XP_009430355.4 Pan troglodytes 3769 0.0 98,28 1863
2 XP_030867412.3 Gorilla gorilla 3761 0.0 98,23 1863
gorilla
3 NP_001288687.1 Pan paniscus 3758 0.0 98,17 1860
4 XP_003778880.3 Pongo abelii 3700 0.0 96,83 1863
5 XP_054313672.2 Pongo pygmaeus 3693 0.0 96,73 1863
6 XP_063485116.1 Symphalangus 3668 0.0 96,08 1861
syndactylus
7 NP_001295597.1 Nomascus 3664 0.0 96,03 1863
leucogenys
8 XP_032019636.1 Hylobates moloch 3650 0.0 95,76 1861
9 XP_011723303.2 Macaca nemestrina 3511 0.0 93,24 1863
10 NP_001289032.1 Papio anubis 3507 0.0 93,19 1863