0% encontró este documento útil (0 votos)
11 vistas35 páginas

Estrategias de ensamblado de genomas

Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
11 vistas35 páginas

Estrategias de ensamblado de genomas

Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Módulo 6: Ensamblado

de genomas
Estrategias de ensamblado: contra referencia y de novo. Ensamblado de lecturas
cortas, largas y estrategias híbridas. Pulido de ensamblado. Evaluación de calidad
de ensamblado. Mapeo de lecturas. Llamado de variantes. Determinación de
ploidía. Anotación automatizada.

1
Secuenciación y ensamblado de genomas
completos

El proceso de ensamblar un genoma es análogo al armado de un rompecabezas. El


genoma se suele fragmentar y se obtienen secuencias cuyo orden debe determinarse
para reconstruir la secuencia del genoma completo.

2
Desafíos en el ensamblado de genomas

¿Qué desafíos pueden presentarse a la hora de ensamblar un genoma?


Colocación de contigs en cromosomas: En genomas diploides, puede ser confuso
determinar a qué cromosoma o haplotipo pertenece cada contig, sobre todo cuando
son similares entre los dos conjuntos de cromosomas. En haploides, este problema
no existe porque solo hay una copia de cada cromosoma.
Regiones repetitivas: Las áreas como telómeros y centrómeros son difíciles de
ensamblar en genomas diploides y haploides. Sin embargo, en los diploides, también
hay que lidiar con la variación entre los dos conjuntos de cromosomas, lo que añade
complejidad.
Contigs cortos o fragmentados: En ambos tipos de genomas (haploides y diploides),
es posible que algunos contigs sean cortos o fragmentados debido a una cobertura
insuficiente o una baja calidad de las lecturas. Esto afecta la calidad general del
ensamblaje.

3
Estrategias de ensamblado
de novo (lecturas
Contra referencia de novo híbrido
cortas o largas)
• Se comparan las • No requiere • Combina
secuencias con un información previa secuenciación de
genoma • Usualmente genera lecturas cortas (ej.
emparentado (ej. un borrador Illumina) y lecturas
misma especie) ya largas (ej.
ensamblado Nanopore)
• Puede obtener un
genoma completo

Dentro de las estrategias de ensamblado podemos encontrar: el ensamblado contra


referencia, el ensamblado de novo con lecturas cortas o largas y el ensamblado de
novo híbrido.
En el ensamblado contra referencia se comparan las secuencias con un genoma
emparentado que ya está ensamblado. Por otra parte, el ensamblado de novo no
requiere información previa, y usualmente lo que obtenemos a partir de un
ensamblado de nuevo es un borrador. Cuando hagamos ese ensamblado
generalmente con lecturas cortas le llamaremos ensamblado de novo. Y cuando
utilicemos tanto lecturas largas como cortas para un ensamblado de novo se trata de
un ensamblado híbrido.

4
Ensamblado contra una referencia
Lecturas • Permite identificar
polimorfismos de una base
(SNPs) e INDELs de corto
tamaño
Mapeo • No permite identificar
(alineamiento)
contra referencia variaciones estructurales (ej.
Rearreglos cromosómicos)
Cromosoma/genoma
Cromosoma/genomade
dereferencia
referencia • Requiere disponer de un
genoma filogenéticamente
Llamado de
Cromosoma/genoma con variantes
cercano
variantes
Cromosoma con variantes

En el ensamblado por comparación de secuencias de ADN contra una referencia, se


alinean las secuencias contra un genoma conocido. Este método es particularmente
útil para identificar polimorfismos de una sola base, conocidos como SNPs, así como
inserciones y deleciones de corto tamaño, o INDELs.
Sin embargo, es importante destacar que esta técnica no permite identificar
variaciones estructurales más complejas, como los rearreglos cromosómicos, que son
cambios más grandes en la estructura del genoma.
Además, para realizar una comparación contra una referencia de manera efectiva, es
necesario disponer de un genoma de referencia que sea filogenéticamente cercano al
organismo en estudio.

5
Ensamblado de novo (lecturas cortas)

Reads • Permite analizar genomas


sin datos previos.
• Problemas en regiones
Contigs repetitivas (son colapsadas,
Región de
estima genomas más cortos
secuencia
desconocida de lo que realmente son).
• Útil si la pregunta a
Scaffolds
responder está en las
R1 R2 regiones no repetitivas.

Borrador Ej: Spades, Velvet

A diferencia de la comparación contra referencia, el ensamblado de novo no requiere


un genoma de referencia previo. Es especialmente útil cuando trabajamos con
organismos cuyo genoma aún no ha sido secuenciado o cuando se espera encontrar
grandes diferencias con los genomas disponibles.
El ensamblado de novo a partir de fragmentos cortos de ADN, tiene como uno de los
desafíos principales la resolución de las regiones repetitivas. Estas regiones pueden
ser problemáticas porque suelen colapsarse durante el ensamblaje, lo que lleva a una
subestimación del tamaño real del genoma. A pesar de esto, el ensamblado de novo
con lecturas cortas sigue siendo muy útil si la pregunta que queremos responder se
enfoca en regiones no repetitivas del genoma.

Ensambladores de novo para lecturas cortas: Los ensambladores como SPAdes y


Velvet son rápidos y efectivos para genomas pequeños y simples, pero tienen
dificultades con genomas complejos y regiones repetitivas.

6
Ensamblado de novo (lecturas largas)
Reads • Ensamblado con lecturas de
PacBio o Nanopore.
• Resolución de regiones
Contigs repetitivas, mejora la
contigüidad.
• Resolución de variantes
Scaffolds estructurales.
• Alta tasa de error de las
lecturas.
Borrador Ej: Canu, Flye

Para el ensamblado de novo también es posible utilizar lecturas largas generadas por
tecnologías como PacBio o Oxford Nanopore. Las ventajas que trae el ensamblado
con lecturas largas es que facilita la resolución de regiones repetitivas ya que las
lecturas largas pueden abarcar regiones repetitivas completas, lo que facilita la
resolución de estas áreas problemáticas y reduce los errores en el ensamblaje. Por
otra parte, mejora la contigüidad: mayor longitud de las lecturas resulta en menos
fragmentos (contigs), lo que conduce a ensamblajes más continuos y cercanos al nivel
de cromosoma. Por último, el uso de lecturas largas permite identificar variantes
estructurales (reordenamientos, duplicaciones, inversiones, etc.) que son difíciles de
detectar con lecturas cortas.
Sin embargo, aunque las lecturas largas cubren más terreno, suelen tener mayores
tasas de error en comparación con las lecturas cortas.
Ejemplos de ensambladores:
•Canu: Optimizado para lecturas largas de PacBio y Oxford Nanopore.
•Flye: Ensamblador rápido y eficiente para lecturas largas.

7
Ensamblado de novo híbrido (lecturas cortas
y largas)
Ensamblado de lecturas
largas • Combina ventajas de lecturas
largas y cortas.
Eliminación de
secuencias de organelas
• Las lecturas cortas se usan
para corregir los errores de las
Mapeo de lecturas lecturas largas
cortas
• Permite acercarse al nivel de
cromosoma
Pulido
Ej: Unicycler
Análisis de calidad de
ensamblado

Ensamblado (a nivel de
cromosoma)

El ensamblado híbrido es una estrategia que combina las ventajas de las lecturas
largas y cortas para obtener un ensamblaje de genoma más completo y preciso.
Como ya mencionamos, las lecturas largas son muy buenas para abarcar estas
regiones repetitivas y ayudar a conectar fragmentos de ADN distantes, pero suelen
tener una tasa de error más alta. Aquí es donde entran en juego las lecturas cortas.
En un ensamblado híbrido, utilizamos lecturas cortas para corregir los errores en las
lecturas largas, mejorando así la precisión del ensamblaje final. Esto permite obtener
una secuencia más precisa y completa, que puede acercarse al nivel de resolución de
un cromosoma completo.

8
Proceso post-ensamblaje  corregir errores en
las secuencias ensambladas.

• Inserciones, deleciones, o sustituciones (durante la


secuenciación o el ensamblaje).
• Ambigüedades en regiones repetitivas o de baja
cobertura.
• Mejorar la continuidad del ensamblado.
• Optimizar la precisión del ensamblado para estudios
posteriores.
Pulido de un
ensamblado

El pulido es un proceso post-ensamblaje que busca corregir errores en las secuencias


ensambladas. Estos errores pueden incluir inserciones, deleciones, o sustituciones
que ocurrieron durante la secuenciación o el ensamblaje.
Además, en el proceso de pulido se puede:
- Resolver ambigüedades en regiones repetitivas o mal cubiertas.
- Mejorar la continuidad del ensamblado al unir contigs y reducir gaps (brechas).
- Optimizar la precisión del ensamblado para estudios posteriores, como anotación
de genes y análisis funcionales.

9
Corrección basada en lecturas: Utiliza lecturas de alta precisión (short-reads) para corregir
errores en ensamblados generados por lecturas largas (long-reads).

Pulido de un
ensamblado Luan et al 2024

Ej: Pilon, Racon, Medaka (correcciones basadas en diferentes algoritmos y estrategias).

El proceso de pulido se realiza por corrección basada en lecturas. La mayoría de los


softwares de pulido utilizan lecturas de alta precisión (short-reads) para corregir
errores en ensamblados generados por lecturas largas (long-reads). También hay
herramientas basadas en lecturas largas.

Ejemplos de softwares:
Herramientas basadas en lecturas cortas: Utilizan datos de secuenciación de alta
precisión (como Illumina) para corregir errores en el ensamblado inicial. Ejemplos
incluyen Pilon, POLCA, y NextPolish.
Herramientas basadas en lecturas largas: Mejoran los ensamblados generados por
tecnologías de lecturas largas (como Oxford Nanopore y PacBio). Ejemplos incluyen
Medaka y Racon.

10
Evaluación del Ensamblado
• ¿Que deseamos?
• Tamaño cercano al del
genoma
• Pocos contigs y de gran
longitud
• Contigs correctos

• Métricas: estadísticas de
calidad del ensamblado

11
Estadísticas de calidad del ensamblado
Por comparación con otros Sin referencia
ensamblados de la misma especie
o cercana • Número de contigs
• % de genes identificados en
• Tamaño del contig más largo
genomas de referencia (ej. BUSCO)
• Longitud promedio de los
• Fracción del genoma de referencia
contigs/scaffolds
(QUAST)
• N50, N90
• NGA50, LGA50
• L50, L90
• Número de mismatches/INDELs/N
por 100kb (QUAST)

Estadísticas para evaluar calidad de un ensamblado:


Por comparación con otros ensamblados de la misma especie o cercana:
1.% de genes identificados en genomas de referencia (ej. BUSCO): Se utiliza para
evaluar la integridad del ensamblado, buscando genes universales conservados en
grupos de organismos cercanos. Un porcentaje alto sugiere un ensamblado de alta
calidad.
[Link]ón del genoma de referencia (QUAST): Evalúa qué porcentaje del genoma
ensamblado corresponde a un genoma de referencia conocido. Un valor alto indica
una mayor cobertura del genoma esperado.
3.NGA50, LGA50: Métricas de longitud de los contigs alineados correctamente con el
genoma de referencia (NGA50) y del número de segmentos (LGA50). Un mayor valor
refleja mejor contigüidad y menor fragmentación en comparación con el genoma de
referencia.
4.Número de mismatches/INDELs/N por 100kb (QUAST): Indica la precisión de las
secuencias ensambladas comparadas con el genoma de referencia, reportando el
número de discrepancias (mismatches), inserciones/deleciones (INDELs) y regiones
no definidas (N) por cada 100 kilobases. Un menor número indica un ensamblado de
mayor precisión.

12
Por otro lado, dentro de las estadísticas que se obtienen sin necesidad de comparar
con una referencia tenemos:
• Número de contigs
• Tamaño del contig más largo
• Longitud promedio de los contigs/scaffolds
• N50, N90
• L50, L90

12
N50
• Ordenamos los
contigs de mayor a
menor
• El tamaño del contig
que cae al 50% del
tamaño del
ensamblado es el
N50

El 50% del genoma está formado por contigs de


tamaño mayor al N50
A mayor N50  mejor calidad de ensamblado

13
L50
• Ordenamos los
contigs de mayor a
menor
• El número de contigs
para llegar al 50%
del tamaño del
ensamblado es el
L50 L50 = 5

Al menos el 50% del genoma está formado por


L50=5 contigs
A Menor L50  mejor calidad de ensamblado

14
Problemas del N50 y L50
• Dependen del largo del ensamblado
• No son comparables entre especies
• No son comparables entre ensamblados de la
misma especie si son de distinto tamaño
• Pueden tener sesgos cuando se filtran contigs de
pequeño tamaño

15
Evaluación por comparación
• NG50 y LG50
• En lugar de calcularlo sobre el largo del ensamblado, se hace sobre el largo
de un genoma de referencia
• Comparable entre especies y ensamblados de diferente tamaño
• Requiere conocer el tamaño del genoma

• NGA50 y LGA50
• Se eliminan de los contigs regiones que no alinean con el genoma de
referencia y se cortan aquellos que no son continuos
• Se calcula luego como el NG50 o LG50.
• Tiene en cuenta a la secuencia del genoma de referencia
• Requiere un genoma de referencia cercano

16
Evaluación por comparación

Se basa en la búsqueda de genes ortólogos


universales presentes en especies cercanas

BUSCO es una herramienta bioinformática que evalúa la calidad de ensamblajes


genómicos. Se basa en la búsqueda de genes ortólogos universales presentes en
especies cercanas. Permite evaluar integridad del ensamblaje y medir la completitud
de los genomas.
Como mencionamos BUSCO analiza la presencia de genes ortólogos de alta
universalidad y baja duplicabilidad. BUSCO se concentra en aquellos genes de copia
única que son compartidos por más del 90% de las especies. Utilizaremos esta
herramienta en la práctica de esta semana.

17
Usos:
1. Ensamblaje de genomas contra
referencia
2. Análisis de variantes (SNPs, indels,
etc.)
3. Detección de genes o regiones
específicas
4. Metagenómica
Mapeo de 5. Transcriptómica (RNA-Seq)
6. ChIP-Seq, ATAC-Seq, y otras
lecturas técnicas de interacción ADN-
proteína
7. Validación de ensamblajes de
novo

¿Cuándo hacemos un mapeo de lecturas contra una referencia?


1. Ensamblaje de genomas contra referencia: Vimos anteriormente que el mapeo de
lecturas es un proceso necesario para el ensamblaje de genomas contra referencia,
cuando tienes una referencia genómica y quieres ensamblar un genoma nuevo o
comparar uno existente, mapeas las lecturas al genoma de referencia para identificar
diferencias (como SNPs, indels, etc.).
2. Análisis de variantes (SNPs, indels, etc.): El mapeo de lecturas permite identificar
variantes genéticas comparando las lecturas con un genoma de referencia. Esto se
usa comúnmente en estudios de genética de poblaciones, evolución, o enfermedades
genéticas.
3. Detección de genes o regiones específicas: Se puede mapear lecturas para buscar
la presencia o ausencia de genes o regiones específicas en un organismo, como genes
de resistencia a antibióticos en bacterias.
4. Metagenómica: En estudios metagenómicos, el mapeo de lecturas permite
identificar y cuantificar especies presentes en una muestra comparando las lecturas
con un conjunto de genomas de referencia.
5. Transcriptómica (RNA-Seq): En estudios de expresión génica, las lecturas de RNA se
mapean contra un genoma o transcriptoma para cuantificar la abundancia de
transcritos y estudiar la regulación génica.

18
6. ChIP-Seq, ATAC-Seq, y otras técnicas de interacción ADN-proteína: Estas técnicas
generan lecturas que se mapean al genoma para identificar sitios de interacción
proteína-ADN, regiones accesibles del genoma, o regiones modificadas
epigenéticamente.
7. Validación de ensamblajes de novo: Tras un ensamblaje de novo, el mapeo de
lecturas puede usarse para validar la calidad del ensamblado, confirmando si las
lecturas se alinean bien con el ensamblaje generado.
En resumen, el mapeo de lecturas es una técnica versátil utilizada para ensamblajes
contra referencias, análisis de variantes, cuantificación de genes y transcritos,
estudios de metagenómica, y más.

18
Herramientas comunes para mapeo:
• BWA (Burrows-Wheeler Aligner)
• Bowtie

Archivo resultante: SAM/BAM


• SAM (Sequence Aligment/Map).
• BAM: equivalente binario del SAM. Para análisis posteriores

Mapeo de
lecturas

Herramientas comunes para mapeo: BWA (Burrows-Wheeler Aligner), Bowtie.

A partir de un mapeo se obtienen archivos: SAM/BAM


• SAM (Sequence Aligment/Map): archivo de texto separado por tabulaciones,
leíble.
• BAM: equivalente binario del SAM. Para análisis posteriores

El archivo SAM comienza con un encabezado, que es opcional. El encabezado se usa


para describir la fuente de los datos, la secuencia de referencia, el método de
alineación, etc. Esto variará dependiendo del alineador que se esté utilizando. Cada
sección comienza con el carácter ‘@’ seguido por un código de tipo de registro de dos
letras. Estos son seguidos por etiquetas de dos letras y valores.

19
Herramientas comunes para mapeo:
• BWA (Burrows-Wheeler Aligner)
• Bowtie

Archivo resultante: SAM/BAM


• SAM (Sqeuence Aligment/Map).
• BAM: equivalente binario del SAM. Para análisis posteriores

Mapeo de
lecturas

Después del encabezado está la sección de alineación. Cada línea corresponde a la


información de alineación para una única lectura. Cada línea de alineación tiene 11
campos obligatorios para la información esencial de mapeo y un número variable de
otros campos para información específica del alineador.
Un ejemplo de mapeo de lecturas se muestra arriba. Ten en cuenta que el ejemplo
anterior abarca dos líneas, pero en el archivo real es una sola línea. Vamos a revisar
los campos uno por uno.
QNAME: Nombre de la consulta o nombre de la lectura - este es el mismo nombre de
lectura que aparece en el encabezado del archivo FASTQ.
FLAG: Valor numérico que proporciona información sobre el mapeo de la lectura y si
la lectura es parte de un par. Los detalles sobre los valores de FLAG están disponibles.
RNAME: Es el nombre de la secuencia de referencia, indicando el cromosoma al que
se mapea la lectura. La lectura del ejemplo es del cromosoma 1, lo que explica por
qué vemos ‘chr1’.
POS: Se refiere a la posición más a la izquierda del alineamiento, basada en 1.
MAPQ: Nos da la calidad del alineamiento, cuya escala dependerá del alineador
utilizado.
CIGAR: Es una secuencia de letras y números que representan las ediciones u
operaciones necesarias para hacer coincidir la lectura con la referencia. Las letras son

20
operaciones que indican qué bases se alinean con la referencia (por ejemplo,
coincidencia, desajuste, deleción, inserción), y los números indican las longitudes de
bases asociadas con cada ‘operación’. Por ejemplo, en la imagen SAM a continuación,
el 100M representa que los 100 pb coinciden con el genoma (sin inserciones,
deleciones ni huecos).
Los siguientes tres campos son más relevantes para datos de lecturas emparejadas
(paired-end).
MRNM: es el nombre de referencia del compañero.
MPOS: es la posición del compañero (basada en 1, la más a la izquierda).
ISIZE: es el tamaño del inserto inferido.
Finalmente, tienes los datos de secuencia sin procesar del archivo FASTQ original
almacenados para cada lectura:
SEQ: es la secuencia sin procesar.
QUAL: son los valores de calidad asociados para cada posición en la lectura.

20
Archivo BAM (Binary Alignment MAP):
Información sobre:
• Posición de lectura sobre el genoma de referencia
• Orientación de la lectura
• Calidad del alineamiento/mapeo

Visualización de un archivo .bam en IGV

Mapeo de
lecturas

La información del mapeo de nuestras lecturas al genoma de referencia se


guarda en archivos formato BAM (Binary Alignment MAP). Estos archivos tienen
información sobre: la posición de las lecturas sobre el genoma de referencia, la
orientación de las mismas y la calidad del alineamiento/mapeo.
En esta diapositiva mostramos una representación gráfica de un archivo .bam.
Esta visualización se hace con el programa IGV. En la parte superior de la
ventana vemos el genoma de referencia. Las barras grises representan las
lecturas alineadas contra el genoma de referencia. La flecha roja indica un SNP
en la posición 761155, el genoma de referencia tiene una C en esa posición
mientras que las lecturas una T.

21
Identificación de diferencias genéticas (variantes)
respecto a un genoma de referencia.

Tipos de variantes:
• SNPs (polimorfismos de un solo nucleótido)
• INDELs (inserciones y deleciones)
• Variantes estructurales (duplicaciones, inversiones,
translocaciones)
Llamado de
Herramientas comunes:
variantes • GATK (Genome Analysis Toolkit)
• FreeBayes
• VarScan

Una vez que tenemos las lecturas mapeadas contra el genoma de referencia haremos
el llamado de Variantes. Es decir, la Identificación de diferencias genéticas (variantes)
respecto a ese genoma de referencia.
Tipos de variantes:
• SNPs (polimorfismos de un solo nucleótido)
• INDELs (inserciones y deleciones)
• Variantes estructurales (duplicaciones, inversiones, translocaciones)
Herramientas comunes:
• GATK (Genome Analysis Toolkit)
• FreeBayes
• VarScan

22
Cobertura: cuantas veces una base ha ido secuenciada

Cuando se analizan las variantes luego de un mapeo, es importante tener en cuenta


la cobertura. Ya que nos permitirá distinguir si realmente se trata de una variante o
no. Para poder estar seguros de una asignación de una base en determinada
posición, esta debe tener una cobertura alta. Recordemos que la cobertura se refiere
al número de veces que una base ha sido secuenciada.

23
SNPs (polimorfismos de un solo nucleótido)

Llamado de
variantes

24
Variantes estructurales: Grandes
deleciones o duplicaciones

Duplicación

Llamado de
variantes Deleciones

Mas allá de los SNPs podemos detectar otros tipos de mutaciones como grandes
deleciones o duplicaciones. En la izquierda se muestran 4 genomas alineados contra
un genoma de referencia (en la parte inferior). Las curvas en negro muestran la
cobertura (cantidad de reads alineadas contra la referencia en cada posición). Se ve
muy baja cobertura ciertas regiones indicando deleciones, es decir porciones del
genoma que están presentes en la referencia, pero no en los genomas bajo estudio.
Por otra parte, en la figura de la derecha, observamos una región del genoma con una
cobertura superior que podría indicar una duplicación en el genoma bajo estudio.

25
Archivos VCF (Variant Calling Format)

Llamado de
variantes

La información de las variantes se almacena en archivos VCF (Variant Calling Format).


En la primera columna se indica el cromosoma, luego la coordenada donde se
encuentra esa variante, luego la base de referencia, y en la siguiente columna la base
que tiene tu genoma de estudio como alternativa. La siguiente base indica la calidad
de mapeo.
Mas abajo hay más información, por ejemplo “DP” es depth es decir la cobertura en
esa posición.

26
Proceso para determinar el número de copias de cada
cromosoma en un organismo.

Determinación de ploidía usando datos de NGS


Requiere:
1. Mapeo
2. Llamado de variantes (SNPs alelos)
Determinación de 3. Análisis de la cobertura de lecturas en esas variantes
ploidía

La secuenciación por NGS es una alternativa a la citometría de flujo para la


determinación de ploídia, es decir la determinación del número de copias de cada
cromosoma en un organismo.
El método de determinación de ploidía mediante NGS consiste en contar el número
de lecturas que soportan los diferentes alelos en cada posición a lo largo de la
secuencia del genoma.
Requiere:
1. Mapeo
2. Llamado de variantes (SNPs alelos)
3. Análisis de la cobertura de lecturas en esas variantes

27
Diploide

Determinación de
ploidía

Tetraploide
Triploide

En esta diapositiva vemos gráficos que muestran la frecuencia de los alelos o


variantes detectadas a lo largo de un cromosoma. Si un genoma fuera haploide, en
todas las posiciones del genoma todas las lecturas deberían soportar un único alelo,
sin considerar por supuesto los posibles errores introducidos por la secuenciación. En
cambio, en un organismo diploide uno espera encontrar que la mitad de las lecturas
soportan un alelo (por ejemplo, el alelo que tiene el genoma de referencia contra el
que hicimos el mapeo) y que la otra mitad soporte un alelo alternativo, como se ve
en la figura. En un triploide, en sitios multialelicos se esperaria que un tercio de las
lecturas soporte a cada alelo o si son bialelicos 2/3 de las lecturas soportan un alelo y
el tercio restante el otro. En tretraploides por otra parte se esperaría un cuarto de las
lecturas soportando cada alelo si hubieran 4 alelos diferentes.

28
Anotación de genomas
• Agregar información tanto estructural
como funcional a la secuencia del genoma
ensamblado:
• Regiones codificantes (CDS), intrones-
exones, codones start/stop
• Identificación: proteínas codificadas,
péptidos señal, sitios transmembrana,
sitios de glicosilación, etc.

Anotar un genoma es agregar información tanto estructural como funcional a la


secuencia del genoma ensamblado. Si no agregáramos esta información los genomas
no serían más que una colección de letras sin ningún significado biológico. Cuando
decimos información estructural nos referimos a identificar las regiones codificantes,
dónde se encuentran los cinturones exones, dónde están los codones de inicio y
terminación de la transcripción. Y, por otra parte, cuando hablamos de la información
funcional nos referimos a la identificación de las proteínas codificadas donde se
encuentran los péptidos señal los sitios transmembrana posibles sitios de
glicosilación, etc.

29
Pasos en la anotación:
1. Predicción (genes, regiones regulatorias, etc)
2. Comparación con bases de datos conocidas
3. Anotación funcional y estructural

Anotación
automatizada

El proceso de anotación implica la predicción de, por ejemplo, los genes o regiones
regulatorias y la comparación de esa información con bases de datos conocidas para
luego realizar la anotación tanto funcional como estructural en sí. En la figura, se
muestra por ejemplo un fragmento de ADN anotado indicando en verde la región
correspondiente al gen de la de Delta toxina con su codón de inicio, corriente arriba
está indicado en rojo el sitio de unión al ribosoma. También se indica un ARN de
transferencia. Y más abajo y naranja una repetición en tándem y un homopolímero.

30
Herramientas comunes para anotación:
• Prokka
• MAKER
• RAST

Dentro de las herramientas más comunes de anotación podemos mencionar a


Prokka, MAKER, RAST. En la práctica de esta semana utilizaremos Prokka para anotar
un genoma bacteriano.
Prokka es un algoritmo automatizado de anotación que ejecuta varias herramientas
para anotar genomas procariotas. La entrada es el ensamblaje del genoma en
formato FASTA. Luego, ese ensamblaje se compara con varias bases de datos. Por un
lado, Prokka ejecuta Aragorn para anotar los ARN de transferencia. Los ARN
ribosomales se anotan con RNAmmer. Infernal utiliza la base de datos Rfam para
anotar ARN no codificantes. Finalmente, Prodigal anota los genes codificantes. Cada
secuencia codificante se compara luego con la base de datos de secuencias SwissProt
utilizando Blast, y con las bases de datos de motivos TIGR y Pfam utilizando Hmmer3.
También se ejecuta SignalP para detectar péptidos señal en cada secuencia
codificante predicha. El resultado final del algoritmo de Prokka es un conjunto de
archivos GFF3, GBK y ASN1.

31
Gracias!

Unidad de Epidemiología Molecular Instituto de Patología Experimental “Dr.


Miguel Ángel Basombrío”

Bibliografía
Zhang, P.; Jiang, D.; Wang, Y.; Yao, X.; Luo, Y.; Yang, Z. Comparison of De Novo
Assembly Strategies for Bacterial Genomes. Int. J. Mol. Sci. 2021, 22, 7668.
https:// [Link]/10.3390/ijms22147668
Luan T, Commichaux S, Hoffmann M, Jayeola V, Jang JH, Pop M, Rand H, Luo Y.
Benchmarking short and long read polishing tools for nanopore assemblies: achieving
near-perfect genomes for outbreak isolates. BMC Genomics. 2024 Jul 8;25(1):679.
doi: 10.1186/s12864-024-10582-x. PMID: 38978005; PMCID: PMC11232133.

32

También podría gustarte