Diplomando en
Bioinformática
Modulo 2
Número de sesión
13
Transcriptómica: Normalización
y análisis de datos de RNA-Seq
M. en C. Verónica Torres Banda
Puntos claves sesión 13
Alineamiento de genomas y transcriptomas.
Mapeo de lecturas contra un genoma de
referencia.
Ensamblaje de novo del transcriptoma.
2
Ensamble de lecturas
• El proceso de unir y mezclar un gran
número de lecturas cortas para
reconstruir la secuencia original de:
• Genoma: Es el conjunto de
cromosomas que integran el
DNA.
• Transcriptoma: Es el conjunto de
transcritos expresados en una
condición especifica.
3
Tipo de ensamble según el organismo
Ensamble referenciado
Especies modelo: Genoma secuenciado y anotado.
Transcriptoma anotado
Mapas con marcadores moleculares
Ensamble referenciado / de novo
Especies no modelo: Draft del genoma, algunas Mus musculus
anotaciones disponibles.
Ensamble de novo
Especie nueva: Nada o poca secuenciación.
Dendroctonus Humboldtiana
ponderosae buffoniana
4
Ensamble referenciado
Referenciado
Utiliza un genoma de
referencia
Máxima sensibilidad
Dependen de una
referencia correcta
5
HISAT2-StringTie-Ballgown Pipeline
1. Alineación con HISAT2:
HISAT2 (Hierarchical Indexing for Spliced Alignment of
Transcripts) alinea las lecturas a un genoma de referencia
utilizando un índice jerárquico que permite una alineación
rápida y precisa en formato SAM/BAM.
2. Ensamble y cuantificación con StringTie:
StringTie toma los archivos SAM/BAM como entrada y
ensambla los transcritos, identificando isoformas y estimando
su nivel de expressión (FPKM/TPM) en un archivo GTF.
3. Análisis de expresión diferencial con Ballgown:
Ballgown toma los resultados de StringTie y realiza un análisis
estadístico para identificar genes e isoformas con expresión
diferencial entre diferentes muestras o condiciones.
Lineas de comandos
[Link]
ac3309450f9648e98bec034377beba46
6
Ensamble de novo
de novo
No requiere
referencia
Gráficos de Brujin
Puede formar
chimeras
7
Trinity Pipeline
Ensambles de novo
Lecturas de Illumina
Single-read o Paired-read
Gráficos de Brujin
Identifica isoformas
[Link]
8
Fundamento de Trinity
• Fases:
• Inchworm: Genera y ensambla kmeros
en contigs.
• Chrysalis: Sobrepone los contigs para
construir gráficos de Brujin.
• Butterfly: Resuelve los gráficos de Brujin
para generar transcritos con sus
isoformas.
9
Línea de comandos para Trinity
Básico para paired-read
$ Trinity --seqType fq --left reads_1.fq --right reads_2.fq --CPU <int> --max_memory <int>
Ejemplo
$ Trinity --seqType fq --CPU 12 --max_memory 30G --left \
Nombre_R1_paired.fq,Nombre_R1_unpaired.fq --right \
Nombre_R2_paired.fq,Nombre_R2_unpaired.fq --bflyCPU 12
• Usa secuencias en formato fasta (.fa) o fastq (.fq).
• Los archivos de entrada pueden estar comprimidos (.gz) o no.
• Usa todas las lecturas de buena calidad (paired y unpaired del proceso de depuración).
• Debe establecerse el número de núcleos (--CPU) y la cantidad máxima de memoria (--
max_memory) que podrá usar el programa.
• Para hacer más eficiente la fase de Butterfly especificar el máximo de nucleos que puede
usar (--blyCPU).
10
Archivo de salida Trinity
trinity_out_dir: Contiene las carpetas y archivos generados para realizar el ensamble.
[Link]: Contiene las secuencias de los transcritos ensamblados.
TRINITY_DN2556_c0_g1_i1
g = Gen
i = Isoforma
11
Evaluación de la calidad del ensamble
$ TRINITY_HOME /util/[Link] \
Nx50: Longitud promedio del 50% de los [Link] > Estadisticos_ensamble.txt
transcritos.
Requiere archivos en lenguaje Perl (.pl)
ubicados en la carpeta util de Trinity.
$ TRINITY_HOME /util/misc/fasta_seq_length.pl [Link] \
> [Link].seq_lens
12
Validación del Ensamble de novo
Porcentaje de lecturas mapeadas: Corresponde al porcentaje
de las lecturas mapeadas (alineadas) a los transcritos ensamblados
de manera correcta.
Clea-reads
Transcrito 1 Transcrito 2
Transcrito 1 Transcrito 2
Mapeo de reads
Clea-reads
Ensamble
de novo Porcentaje de lecturas
mapeadas al
Transcrito 1 Transcrito 2
Clea-reads ensamble > 80%
$ bowtie2-build [Link] [Link]
Programas requeridos:
$ bowtie2 -p 10 -q --no-unal -k 20 -x [Link] -1 reads_1.fq -2 \ Bowtie2
reads_2.fq 2>align_stats.txt| samtools view -@10 -Sb -o [Link] Samotools
13
Herramientas para la evaluación de calidad
Analiza los ensambles
transcriptómicos de tres maneras Herramienta utilizada para evaluar
clave: la integridad de los ensambles
genómicos y transcriptómicos
1. Revisando los transcritos
2. Mapeo de las lecturas a los
mediante la presencia de genes
transcritos ortólogos de copia única.
3. Alineamiento de los transcritos
con proteínas o transcripciones de
referencia.
14
BUSCO: Permite realizar la búsqueda de genes
[Link]
ortólogos altamente conservados dentro de los
genomas y transcriptomas ensamblados.
Requerimientos:
Archivos:
Ensamble en
formato .fasta.
Base de datos de un linaje
cercano.
Programas:
Ambiente Conda en
terminal
Busco
Python3
15
Línea de comandos para BUSCO
$ busco -i [SEQUENCE_FILE] -l [LINEAGE] -o [OUTPUT_NAME] -m [MODE] [OTHER OPTIONS]
Opciones de ejecución:
-i Archivo de entrada
-o Archivo de salida
-m Modo (geno, trans o prot)
-l Linaje (base de datos de ortologos).
Ejemplo:
$ busco -i [Link] -l endopterygota_odb10 -m transcriptome -o ensamble_BUSCO
##Generar gráfico BUSCO
$ python3 scripts/generate_plot.py –wd BUSCO_summaries
16
Clustering y Unigenes
Clustering: Es una técnica que se utiliza en análisis de datos para
identificar grupos o "clústeres" de elementos que comparten
características similares.
Unigenes: Secuencias de nucleotidos únicas identificadas a partir de un
transcriptoma. Estas secuencias representan genes únicos que se están
expresando en una célula o población de células, y se utilizan para
estudiar la expresión génica y la función de los genes.
17
Identificación y análisis de unigenes
CD-HIT: Elimina transcritos redundantes, al agrupar [Link]
las isoformas de un gen en base a su identidad.
.clstr file
Opciones de ejecución:
-i Archivo de entrada
-o Archivo de salida
-c Valor de identidad 0-1
-n Longitud del k-mers
-M Limite de memoria en MB
-T Número de CPUs asignados
Archivos de salida:
.fatsa: Conjunto de transcritos no redundantes en formato fasta.
.clstr: Distribución de los transcritos orinales en los cluster generados.
$ cd-hit-est -i [Link] -o Ensamble_cdhit.fasta -c 0.95 -n 8 -M 16000 -T 4
18
Preguntas al capacitador:
capacitacion@[Link]
52 1 55 2689 2869
19