0% encontró este documento útil (0 votos)
9 vistas19 páginas

Ensamblaje de Novo en Transcriptómica

La sesión 13 del Diplomado en Bioinformática se centra en la normalización y análisis de datos de RNA-Seq, abordando el alineamiento de genomas y transcriptomas, así como el ensamblaje de novo. Se presentan herramientas y pipelines como HISAT2, StringTie y Trinity para el análisis de expresión diferencial y la validación del ensamblaje. Además, se discuten técnicas de clustering y la identificación de unigenes para el estudio de la expresión génica.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
9 vistas19 páginas

Ensamblaje de Novo en Transcriptómica

La sesión 13 del Diplomado en Bioinformática se centra en la normalización y análisis de datos de RNA-Seq, abordando el alineamiento de genomas y transcriptomas, así como el ensamblaje de novo. Se presentan herramientas y pipelines como HISAT2, StringTie y Trinity para el análisis de expresión diferencial y la validación del ensamblaje. Además, se discuten técnicas de clustering y la identificación de unigenes para el estudio de la expresión génica.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Diplomando en

Bioinformática
Modulo 2
Número de sesión
13

Transcriptómica: Normalización
y análisis de datos de RNA-Seq

M. en C. Verónica Torres Banda


Puntos claves sesión 13

Alineamiento de genomas y transcriptomas.

 Mapeo de lecturas contra un genoma de


referencia.

 Ensamblaje de novo del transcriptoma.

2
Ensamble de lecturas
• El proceso de unir y mezclar un gran
número de lecturas cortas para
reconstruir la secuencia original de:

• Genoma: Es el conjunto de
cromosomas que integran el
DNA.

• Transcriptoma: Es el conjunto de
transcritos expresados en una
condición especifica.

3
Tipo de ensamble según el organismo
Ensamble referenciado
Especies modelo: Genoma secuenciado y anotado.
Transcriptoma anotado
Mapas con marcadores moleculares

Ensamble referenciado / de novo


Especies no modelo: Draft del genoma, algunas Mus musculus
anotaciones disponibles.

Ensamble de novo
Especie nueva: Nada o poca secuenciación.

Dendroctonus Humboldtiana
ponderosae buffoniana

4
Ensamble referenciado
Referenciado

Utiliza un genoma de
referencia

Máxima sensibilidad

Dependen de una
referencia correcta

5
HISAT2-StringTie-Ballgown Pipeline
1. Alineación con HISAT2:
HISAT2 (Hierarchical Indexing for Spliced Alignment of
Transcripts) alinea las lecturas a un genoma de referencia
utilizando un índice jerárquico que permite una alineación
rápida y precisa en formato SAM/BAM.

2. Ensamble y cuantificación con StringTie:


StringTie toma los archivos SAM/BAM como entrada y
ensambla los transcritos, identificando isoformas y estimando
su nivel de expressión (FPKM/TPM) en un archivo GTF.

3. Análisis de expresión diferencial con Ballgown:


Ballgown toma los resultados de StringTie y realiza un análisis
estadístico para identificar genes e isoformas con expresión
diferencial entre diferentes muestras o condiciones.

Lineas de comandos
[Link]
ac3309450f9648e98bec034377beba46
6
Ensamble de novo

de novo

No requiere
referencia

Gráficos de Brujin

Puede formar
chimeras

7
Trinity Pipeline

Ensambles de novo

Lecturas de Illumina
Single-read o Paired-read

Gráficos de Brujin

Identifica isoformas

[Link]
8
Fundamento de Trinity
• Fases:

• Inchworm: Genera y ensambla kmeros


en contigs.

• Chrysalis: Sobrepone los contigs para


construir gráficos de Brujin.

• Butterfly: Resuelve los gráficos de Brujin


para generar transcritos con sus
isoformas.

9
Línea de comandos para Trinity
Básico para paired-read
$ Trinity --seqType fq --left reads_1.fq --right reads_2.fq --CPU <int> --max_memory <int>
Ejemplo
$ Trinity --seqType fq --CPU 12 --max_memory 30G --left \
Nombre_R1_paired.fq,Nombre_R1_unpaired.fq --right \
Nombre_R2_paired.fq,Nombre_R2_unpaired.fq --bflyCPU 12

• Usa secuencias en formato fasta (.fa) o fastq (.fq).


• Los archivos de entrada pueden estar comprimidos (.gz) o no.
• Usa todas las lecturas de buena calidad (paired y unpaired del proceso de depuración).
• Debe establecerse el número de núcleos (--CPU) y la cantidad máxima de memoria (--
max_memory) que podrá usar el programa.
• Para hacer más eficiente la fase de Butterfly especificar el máximo de nucleos que puede
usar (--blyCPU).

10
Archivo de salida Trinity
trinity_out_dir: Contiene las carpetas y archivos generados para realizar el ensamble.
[Link]: Contiene las secuencias de los transcritos ensamblados.

TRINITY_DN2556_c0_g1_i1

g = Gen
i = Isoforma

11
Evaluación de la calidad del ensamble
$ TRINITY_HOME /util/[Link] \
Nx50: Longitud promedio del 50% de los [Link] > Estadisticos_ensamble.txt
transcritos.

Requiere archivos en lenguaje Perl (.pl)


ubicados en la carpeta util de Trinity.

$ TRINITY_HOME /util/misc/fasta_seq_length.pl [Link] \


> [Link].seq_lens

12
Validación del Ensamble de novo
Porcentaje de lecturas mapeadas: Corresponde al porcentaje
de las lecturas mapeadas (alineadas) a los transcritos ensamblados
de manera correcta.
Clea-reads
Transcrito 1 Transcrito 2
Transcrito 1 Transcrito 2

Mapeo de reads
Clea-reads
Ensamble
de novo Porcentaje de lecturas
mapeadas al
Transcrito 1 Transcrito 2
Clea-reads ensamble > 80%

$ bowtie2-build [Link] [Link]


Programas requeridos:
$ bowtie2 -p 10 -q --no-unal -k 20 -x [Link] -1 reads_1.fq -2 \ Bowtie2
reads_2.fq 2>align_stats.txt| samtools view -@10 -Sb -o [Link] Samotools

13
Herramientas para la evaluación de calidad

Analiza los ensambles


transcriptómicos de tres maneras Herramienta utilizada para evaluar
clave: la integridad de los ensambles
genómicos y transcriptómicos
1. Revisando los transcritos
2. Mapeo de las lecturas a los
mediante la presencia de genes
transcritos ortólogos de copia única.
3. Alineamiento de los transcritos
con proteínas o transcripciones de
referencia.

14
BUSCO: Permite realizar la búsqueda de genes
[Link]
ortólogos altamente conservados dentro de los
genomas y transcriptomas ensamblados.

Requerimientos:

Archivos:
Ensamble en
formato .fasta.
Base de datos de un linaje
cercano.

Programas:
Ambiente Conda en
terminal
Busco
Python3

15
Línea de comandos para BUSCO
$ busco -i [SEQUENCE_FILE] -l [LINEAGE] -o [OUTPUT_NAME] -m [MODE] [OTHER OPTIONS]

Opciones de ejecución:

-i Archivo de entrada
-o Archivo de salida
-m Modo (geno, trans o prot)
-l Linaje (base de datos de ortologos).

Ejemplo:

$ busco -i [Link] -l endopterygota_odb10 -m transcriptome -o ensamble_BUSCO


##Generar gráfico BUSCO
$ python3 scripts/generate_plot.py –wd BUSCO_summaries

16
Clustering y Unigenes

Clustering: Es una técnica que se utiliza en análisis de datos para


identificar grupos o "clústeres" de elementos que comparten
características similares.

Unigenes: Secuencias de nucleotidos únicas identificadas a partir de un


transcriptoma. Estas secuencias representan genes únicos que se están
expresando en una célula o población de células, y se utilizan para
estudiar la expresión génica y la función de los genes.

17
Identificación y análisis de unigenes
CD-HIT: Elimina transcritos redundantes, al agrupar [Link]
las isoformas de un gen en base a su identidad.
.clstr file
Opciones de ejecución:
-i Archivo de entrada
-o Archivo de salida
-c Valor de identidad 0-1
-n Longitud del k-mers
-M Limite de memoria en MB
-T Número de CPUs asignados

Archivos de salida:
.fatsa: Conjunto de transcritos no redundantes en formato fasta.
.clstr: Distribución de los transcritos orinales en los cluster generados.

$ cd-hit-est -i [Link] -o Ensamble_cdhit.fasta -c 0.95 -n 8 -M 16000 -T 4

18
Preguntas al capacitador:

capacitacion@[Link]

52 1 55 2689 2869

19

También podría gustarte