Bioinformática al permite tener una idea ese de qué cosa es que
cosa puede estar haciendo por ejemplo un determinado gen cuál
sería la función de un determinado gen, dónde estaría ubicado el
producto de ese gen, por ejemplo, si el gen codifica una proteína,
esa proteína donde se ubica, se ubica solo en el espacio celular o en
la membrana celular o en el plasmodesmo, se ubique en el núcleo,
se ubica en el citoplasma, se ubica en la membrana nuclear.
Toda esa información es posible obtener utilizando el informático
entonces la bioinformática permite explorar los datos y también
organizar datos como mencioné hace un rato, si ustedes mandan a
secuenciar ahora como dije es muy barato secuenciar el genoma de
una bacteria, un hongo, un virus es más fácil todavía porque recuerden que los virus tienen un genoma muy
pequeño. Lo más difícil ahora es qué hacer con resultados qué hacer con los datos entonces ahí entra a tallar
bioinformática.
La bioinformática como imaginarán ustedes se basa en homología
por ejemplo cuando ustedes vamos a ver el caso del trabajo se
demuestra por qPCR que el producto A inducen la resistencia y
verificó que gen PR1 es altamente inducido con el producto A
comparado al control. Muy bien entonces él dice que es el gen PR1
porque usó probablemente primer se específicos para ese gen pero
si él quiere tener otra evidencia de que efectivamente es el gen PR1
el que se está activando por ese inductor, entonces lo que podría
hacer es mandar a secuenciar ese pequeño pedazo amplificado de
PCR mandar a secuencia, entonces mando a secuenciar le envían
una secuencia que es un archivo de texto, donde están las guaninas
la citocinas y qué cosa va a ser para saber qué genes es, lo que va a hacer es un Blast.
Un Blast es utilizar esta herramienta en la web existe en esta
página web se llama el NCBI aquí hay una herramienta que se llama
blast, si uno tiene secuencia de nucleótidos uno utiliza el
nucleotide blast, si uno tiene secuencia de aminoácidos de repente
se ha mandado a hacer proteoma entonces lo que tiene es una
secuencia de aminoácidos entonces ahí se hace protein blast.
Entonces en ese momento ya está usando mi bioinformática en
este caso bioinformática que está disponible en la web, pero qué
cosa hace blast lo que hace es buscar homólogos entonces en la
base de datos busca a semejanzas a la secuencia que usted ha
puesto ahí en la ventanita, entonces eso toma unos segundos a
veces un par de minutos y le dice a la secuencia que usted ha introducido se parece 100%, 80% a este gen o a esta
proteína.
Entonces en la web existen muchas herramientas que están
disponibles y la mayoría son gratis ahora existen obviamente
programas que ustedes pueden instalar en su computadora para
poder hacer no solo obviamente el blast homología sino otro tipo
de análisis, entonces los programas pueden ser de uso amigable. El
command line es un terminal es una pantallita negra.
Existen programas disponibles en la web por ejemplo ORFfinder
identificar genes en una secuencia de nucleótidos ustedes ponen
acá simplemente la secuencia que hay que obtienen de la empresa
que les hace la secuencia y les permite buscar digamos genes,
secuencias de genes, incluso pueden ustedes elegir de qué tamaño
mínimo quieren, incluso si el codón de iniciación es el estándar el ATG o otros no alternativos de iniciación.
EMBOSS backtranseq secuencias de ADN a secuencias de proteínas o de aminoácidos en este caso obviamente
ustedes tienen que si quieren convertir una secuencia de ADN a la secuencia de aminoácidos primero tienen que
asegurarse de que esa secuencia de ADN es una secuencia de ADN codificante es decir y además esté ya alineado
en términos de codones de 3 nucleótidos que forman un codón, si no el programa no va a poder el traducir o
convertir a secuencias de aminoácidos.
Blast esta página web de NCBI es muy útil no solo para blast sino que aquí también hay base de datos es en realidad,
el blast es una herramienta de esta base de datos esta es una base de datos que tiene secuencias de todos los
organismos que han sido enviados a esta base de datos, hay otras bases de datos sin duda pero esta probablemente
sea la más completa. Entonces lo interesante es que estos estas herramientas las permiten la búsqueda automática
desde las bases de datos que tiene esta página entonces tienen que hacer otra cosa más que colocar su secuencia y
el programa se encarga de utilizar las bases de datos disponibles en esta página.
Este otro programa Signal es un programa que permite predecir en qué lugar se ubica dentro de la célula en qué
lugar se ubica una determinada proteína, entonces este programa requiere que ustedes le introduzcan la secuencia
de aminoácidos, entonces le puede decir con probabilidad de 90% la secuencia de aminoácidos usted ha ingresado
se localiza en el núcleo, entonces eso sin duda a usted le sirve es una información muy útil porque por ejemplo
volvamos a nuestro caso del ají silvestre resistente al virus del moteado suave del ají, ustedes con el análisis de
proteoma ya saben que la proteína sufre una modificación post traducción verdad y además con el análisis de
proteoma ustedes tienen la secuencia de aminoácidos entonces esa secuencia aminoácidos colocan en este
programa y les va a decir dónde se ubica. Entonces en ese caso cuál sería la localización si sabemos que la proteína
para que funcione tiene que estar en el plasmodesmo, cuál sería su ubicación su subcelular sería la membrana
celular al borde porque los orificios es decir los plasmodesmos están al borde de las células, conectando una célula
con células.
Otra información muy importante que ustedes necesitan saber ya sea para confirmar la función de una proteína o
para tener una idea de cuál podría ser la función de una determinada proteína es saber obviamente su estructura
su estructura secundaria, la estructura secundaria básicamente es la arreglo en 2 dimensiones de las diferentes tipos
de aminoácidos obviamente la forma en que se arregla los aminoácidos para formar una estructura secundaria
depende mucho de las propiedades de los aminoácidos. Ustedes saben que cada aminoácido tiene una propiedad
su balance de cargas puede ser positiva negativa puede ser ácido básico neutro, basado en esas propiedades
fisicoquímicas la estructura de la proteína tiene una característica en particular, por ejemplo para que una proteína
se localice en la membrana celular debe ser capaz de adherirse a los componentes de la membrana celular ahí hay
por ejemplo ácidos grasos tienen que ser capaz de insertarse ahí y para ello necesita que tenga una estructura el
helicoidal que es la estructura secundaria que es importante que tenga la proteína para poder ubicarse allí en la
membrana celular. Entonces toda esa información ustedes pueden ver que la pueden obtener preliminarmente sin
hacer ningún experimento todavía usando programas.
MAFFT esto es para hacer alineamientos alinear significa colocar
uno sobre otro las secuencias de ya sea de nucleótidos de ADN o
secuencias de aminoácidos usualmente estos programas hacen
alineamiento de secuencias múltiples más de uno mucho más de
uno, entonces la idea de alinear ver en qué parte de la secuencia
se parecen más, por ejemplo si ustedes secuencian el genoma de
una bacteria X y quieren saber la identidad de esa bacteria todo el
genoma o toda la secuencia de ADN en esa bacteria pueden hacer
un blast y les dice bueno se parece al 90% a esta bacteria Z muy
bien ya saben la identidad ahora ustedes quieren saber la relación
filogenética de esa bacteria con otras bacterias, para saber más o
menos con qué bacteria está relacionada saber más o menos de dónde proviene, un poco saber sus ancestros.
Entonces tienen que sacar de la base de datos secuencias de genomas de otras bacterias y todas ponerlas juntas y
así construir un árbol filogenético, entonces para ponerlas juntas tienen que alinearla y para ello necesitan un
programa para hacer alineamiento y uno de ellos el más usados probablemente hay varios no pero el más usado es
el MAFFT.
CIPRES ustedes puedan colocar sus datos acá, osea cargan sus
datos y luego hacen distintos análisis que ustedes que ustedes están
interesados, esta página web tiene ya los programas instalados
ustedes simplemente dicen voy a usar por ejemplo el beast es un
programa que hace análisis de ancestros por ejemplo en la bacteria
que les mencioné hace un rato y quiere saber cuál de dónde
proviene o cuál es el origen de esa bacteria ustedes pueden hacer
un análisis de ancestro por ejemplo el beast puede ayudar en eso.
Entonces existen páginas web dedicadas a este a este tipo de
análisis.
Mega hacen análisis filogenético también pueden hacer
alineamientos algunos ahora incluso la última versión de mega creo
que es el mega X11 puede hacer análisis muy ancestros también
entonces es una herramienta muy poderosa la única desventaja es
que cuando ustedes ponen más de 50, 60 secuencias por ejemplo
de un virus que tiene un tamaño de genoma de 3000 el
nucleótidos, 3000 bases el programa colapsa esa es la desventaja
que les mencionaba que los programas user friendly tiene una
limitación y se imaginan ustedes por ejemplo si están analizando
genoma de una bacteria, si están analizando solo el plásmido de
una bacteria que tiene 40 mil nucleótidos sin duda no se puede
hacer este tipo de análisis no con este programa.
Prank es un programa que permite alinear nucleótidos, pero en
tripletes osea en codones.
la mayoría de los datos que provienen de proteoma de genoma
etcétera son grandes son archivos enormes entonces que pasen
muy difícil que ustedes puedan abrir con un programa user frendly.
Estos programas se han escrito en distintos lenguajes por ejemplo
en Pair que es el más común, Python, java, C++ son programas
netamente que utilizan el command line, el Rstudio
probablemente han escuchado es un programa también que se
puede usar en el comand line y user friendly.
R studio es este programa ya que es como una especie de ilusión
friendly no tanto probablemente es muy parecido al SAS alguno de
ustedes ha tenido ya la oportunidad de interactuar.
Python se parece mucho poquito al R.
Base de datos sin duda son muy útiles como como expliqué sirven
para buscar homologías verdad ustedes tienen una secuencia de un
organismo X ya sea para confirmar o porque por ejemplo en un
laboratorio de diagnóstico rutinario ustedes pueden identificar de
repente Fusarium que les parece particular porque cuando ustedes
corren la clave Fisurium midiendo las macroconidias, el color de la
conidia, llegan a la conclusión de que no es ninguna de las especies
que ustedes conocen verdad las conocidas entonces qué puede ser
entonces pero sí de hecho están seguros que es un Fusarium por
las macro comillas, micro comillas, entonces utilizan un par de
primes que amplifica en la región ITS de todos los hongos entonces
se utilizan para amplificar en esa muestra que ustedes saben que es Fusarium pero no saben qué especie es entonces
amplifican esa región y ese pedazo de amplificado de ADN manda la secuencia una vez, que tengan esa la secuencia
de nucleótidos hacen un blast, el blast es contra las distintas bases de datos que hay obviamente van a usar la base
de datos que de hongos y les dicen que especies y con eso confirman ustedes qué especie de Fusarium tienen al
frente entonces las bases de datos son muy importantes.
Todas estas bases de datos deben ser de acceso público, entonces si una institución ya sea financiada con dinero
estatal del gobierno o dinero público privado pero con una parte de dinero público incluso privado están obligados
a publicar o una copia de su secuencia en una base de datos de acceso público, entonces menos que sea algo
protegido, por ejemplo la base recientemente se terminó de secuenciar el genoma del cacao, café, plátano incluso
de algunos cereales que eran muy difíciles de secuenciar porque esos tenían muchas copias ustedes saben que los
cereales pueden ser tetraploides, sextaploides, es muy difícil de secuenciar pero haciendo un esfuerzo entre varias
instituciones se logró secuenciar y todo eso se deposita en una base de datos de acceso público.
La base de datos más importantes yo les decía es esta que la NCBI
pueden ustedes encontrar muchas bases de datos de la gran mayoría
de los organismos.
Hay bases de datos específicas para cada organismo por ejemplo
para el tomate la última versión es esta que se llama ITAG3.20 este
es mucho más pulido mejorado actualizado las bases de datos
también obviamente se actualizan a medida que la tecnología
avanza por ejemplo antiguamente se hacía la secuenciamiento se
hacía cortando el ADN cada pedazo de ADN se colocaba en un
plásmido y luego sus plásmidos se mandaban a secuenciar, el
secuenciamiento era por el método antiguo y ese ese método
tenía muchos errores, ahora el PackBio por ejemplo hace se puede
secuenciar pedazos de ADN hasta de 5000 nucleótidos en una sola
corrida, entonces son mucho más óptimos y mucho más exactos
entonces se está volviendo a resecuenciar muchos organismos para poder actualizar y corregir los potenciales
errores que había en las versiones anteriores.
Esta institución que se llama Genevestigator tiene una base de
datos de transcriptoma para distintas condiciones y la gran mayoría
en realidad gran parte de esta base de datos es para animales
incluido el hombre pero también tiene una parte importante para
plantas, de hecho esta base de datos para acceder tienes que pagar
que es el pago de suscripción pero lo interesante de esta base de
datos es que tiene el transcriptoma es decir me dice qué genes se
expresan bajo determinadas condiciones en distintas plantas que
ellos tienen en su base de datos.
Por ejemplo, ellos tienen 20 cultivos en su base de datos el tabaco,
Arabidopsis que la planta modelo que les explique las clases, arroz,
maíz entonces por ejemplo se sabe qué genes se expresan en el
tomate cuando estaba floreando cuando está produciendo los
frutos, cuando los frutos se están tornando rojos, incluso cuando
están siendo afectadas por virus.
Entonces lo interesa de esta base de datos es que ustedes pueden
corroborar por ejemplo si ustedes están haciendo un análisis del
transcriptoma en una planta X y con encuentran que determinados
genes están expresando en mayor tasa durante el crecimiento de la
emergencia por ejemplo de la flor entonces esto podrían colaborar
con esta base de datos.
Entonces las funciones que hay en esta base de datos repito que
no es gratis tienes que pagar una suscripción y es por ejemplo
analizar un experimento para encontrar genes que se expresan
significativamente identificar qué condiciones afecta a la expresión
de un gen de interés indicar qué genes son específicamente
expresados en una condición en particular y encontrar
singularidades de expresión entre genes bajo condiciones de
interés. Ustedes pueden preguntarse para qué sirve una cosa así,
sin duda tiene mucha utilidad.
Ustedes por ejemplo podrían en uno de estos cultivos vamos a decir
a soya ustedes utilizando esta base de datos podrían más o menos
sacar una lista de qué genes por ejemplo se expresan cuando la soya está sufriendo estrés por agua, bajo sequía qué
genes se expresan en la soya entonces para ustedes la soya no es importante las digamos no es el cultivo de interés
de repente cultivo de interés de repente para ustedes el cultivo de interés el payar, por ejemplo ustedes saben que
en ica cultivar el payar es cada vez más complicado porque no hay agua, eso es un problema que pasa casi en todo
en todo el mundo cada vez hay menos agua disponible para el riego entonces ustedes pueden más o menos apuntar,
la pregunta qué genes podrían ser alterados en el payar para que la planta de pallar sea más tolerante a la sequía es
la pregunta por qué por qué queremos que el payar esté produciendo igual o mucho mejor que ahora pero con
menos agua ese es el objetivo, entonces si yo me voy de frente al payar a tratar de identificar qué genes es como
buscar una aguja en un pajar, verdad pero si ustedes van a esta base de datos que no tiene payar en su base de datos
pero tiene un cultivo emparentado como la soya, soya al igual que payar es una Fabaceae.
Entonces eso ya ustedes buscan qué genes se expresan cuando la soya está creciendo bajo condiciones de sequía
entonces esa lista de genes puede ustedes sacar las secuencias de ADN tener más o menos la función de esos genes
qué función cumplen y con esa lista que probablemente sean 20 o 30 genes ustedes pueden buscar comprobar que
en el payar primero están presentes esos genes, segundo también se sobreexpresa cuando está creciendo el payar
bajo condiciones de estrés de agua. Entonces la idea es que basado en este conocimiento previo de esta base de
datos puedan inferir en un cultivo parecido.
Sanger sequencing, este método original después
apareció estos de siguiente generación en 2005 que
hacen el secuenciamiento es mucho más rápido
obviamente la secuenciamiento de fragmentos de ADN
un poco más grandes.
El Illumina es mucho más optimo digamos secuenciando genes o
pedazos fragmentos de ADN pero muy pequeños, Illumina se
caracteriza por ser consecuencial fragmentos pequeñitos de 100,
200 hasta 300 bases osea aquí tiene que fragmentarse ADN para
secuenciar.
Pacific biosystems o se conoce comúnmente como PackBio este
método digamos esta tecnología de secuenciamiento permite
secuenciar fragmentos mucho más grandes como les dije incluso
pedazos de ADN hasta de 5000 bases comparen ustedes el
iluminante que es 200, 300 bases a 5000 bases es casi 10 veces más,
ya van a ver ustedes qué problemas hay en secuenciando genomas
muy pequeños no tiene es más rápido y más fácil probablemente
el secuenciamiento es más barato pero tiene una desventaja.
En los equipos de última generación lo que se hace es utilizar estos
adaptadores que ven acá que está simbolizado con nuestras barras
de negro y plomo estos adaptadores son secuencias de 50
nucleótidos que se vende se compra es como un primer pedazos de
ADN que se llama adaptadores las secuencias son conocidas, en el
ADN que uno quiere secuenciar tiene que fragmentarlo osea
hacerle el digamos en pedazos cada uno de estos fragmentos se van
a unir a los adaptadores y luego una vez que los fragmentos de ADN
y que uno está interesado en secuenciar se ha adherido a los
adaptadores se coloca sobre una celda, en esta celda existen
secuencias de ADN que son complementarias a la secuencia de
ADN del adaptador, entonces como son complementarias se van a unir una vez que se ha unido un lado primero se
va a unir el otro lado, recuerden que hay adaptadores en ambos lados del fragmento de ADN que una va secuenciar.
Entonces un primero se une el adaptador a la celda por un lado y luego se une por el otro lado formando esta arco,
una vez que se forman los arcos viene una enzima que se llama ADN polimerasa que va a amplificar va a ser copias
de este ADN que está en forma de arco hace copias y luego que ha hecho copias se produce una disociación osea se
libera uno de estos lados para que se exponga de esta manera en forma vertical los fragmentos del ADN unidas a la
base pero sólo por un lado y luego ahí es donde viene el lector y va leyendo de acuerdo a qué tipo de nucleótido
existe en estos nucleótidos van liberando una determinada luz que lee un aparatito y eso dice que secuencia es, por
ejemplo aquí es timina, adenina y así va un software la leyendo y organizando esos datos en forma lineal.
Entonces lo que lo que ven ustedes aquí es que va a haber mayor número de lecturas para las copias más grandes
obviamente de los fragmentos que están pegadas a la celda y esas copias más grandes van a ser directamente
proporcional a la cantidad que ha sido pegada inicialmente de la muestra, por ejemplo si hubo 20 copias del azul
aquí al final se va a leer probablemente como había una amplificación por PCR aquí entonces de repente ya no hay
20 si no hay 20000 pero sigue el rojo solo hubo una copia entonces aquí al final va a haber solo 1000 copias osea en
otras palabras la mayor cantidad de copias al momento de secuenciar de un determinado fragmento de ADN va ser
directamente proporcional a la cantidad de inputs por eso es que cuando ustedes hacen transcriptoma la única
diferencia entre transcriptoma y esto que acabo de explicar aquí es que estos fragmentos son ADN pero primero ha
sido convertido el ARN del transcriptoma porque el transcriptoma consiste en aislar el ARN mensajero total entonces
primero antes de ponerle al secuenciador se tiene que hacer reverse transcription osea convertir el ARN en ADN,
una vez que se convirtió en el ADN se hace todo este procedimiento.
Entonces si por ejemplo el gen azul corresponde a un gen que se transcribió en mayor cantidad debido a un
tratamiento X que se hizo entonces sobre reguló entonces va a haber muchas copias del azul, entonces al haber
muchas copias del azul va a haber amplificaciones mucho mayores del azul por lo tanto aquí cuando se hace la
lectura va a haber muchas copias del azul entonces ahí yo voy a decir ese gen azul se está sobre regulándolos,
recuerden ese principio la mayor cantidad de copias que se lee depende directamente de la cantidad inicial de input
de dicho gen.
Oxford nanopore este es un pequeño aparato que se puede
conectar a una laptop y uno después coloca la muestra de ADN por
un pequeño orificio con un tip y inmediatamente lo está
secuenciando esta es una tecnología llamada de cuarta generación
y permite ahora secuencial rápidamente cualquier organismo que
ustedes tienen en la mano, sobre todo se usa para virus que tiene
genomas más pequeños y en este caso no se necesita fragmentar
al ADN, este aparato puede leerse puede ser así incluso hasta de
creo que 20000 nucleótidos de hecho has recientemente se ha
utilizado para secuenciar el genoma del covic que tiene 28000
nucleótidos aproximadamente.
Si ustedes por ejemplo quieren secuenciar el genoma de una
bacteria X, la pregunta es cuánto de AND debo de mandar para
secuenciar, entonces y eso depende de cuánta cobertura ustedes
quieren. Cobertura es cuántas copias de una misma región del ADN
ustedes quieren tener para estar seguros obviamente mientras
más cobertura más DEEP así se llama mayor seguridad mayor
exactitud van a tener pero obviamente eso tiene un mayor costo
esto y al mismo tiempo este requiere mayor cantidad de input de
ADN es decir más ADN que tiene que tener una gran calidad el ADN
debe ser realmente puro y eso a veces es un es un desafío, tener
ADN puro de buena calidad para secuenciar para secuenciar ese es
el gran desafío es uno de los grandes desafíos que hay, sobre todo dependiendo de qué organismo ustedes extraen
en ADN.
Por ejemplo, si ustedes quieren secuenciar parte del genoma de la VID “uva” eso realmente es complicado muy
difícil porque la vid que usted sabe que tiene muchos fenoles es un cultivo que se oxida fácilmente.
Dependiendo entonces qué cosa ustedes mandan a secuenciar
puede ser ADN, ARN, amplicons es como ARN mensajero nada más,
Chips seq básicamente es por ejemplo utilizar un anticuerpo que
reconoce ADN que están metilados nada más entonces ustedes
aíslan todo el ADN del organismo utilizan un anticuerpo que sólo
reconoce el ADN metilado, lo agarra digamos con el anticuerpo y
luego ustedes la isla han solo el ADN que ha sido ha tratado por el
anticuerpo y eso mandan a secuenciar eso se llama Chips seq. Y así
hay varios tipos de secuenciamiento obviamente dependiendo qué
es lo que ustedes secuencien.
Qué consideraciones se deben tener en cuenta para un proyecto
de secuencia miento al igual que cualquier experimento definir la
hipótesis eso es fundamental cuál es la hipótesis que cuál es la
hipótesis estudiamos que uno quiere probar si es cierta o no es
cierto eso es fundamental porque eso pone límites al experimento
no es que yo voy a secuestrar este organismo y voy a ver después
que hago con eso, no, tiene que uno tener una hipótesis por qué
voy a secuestrar el genoma de este organismo para qué es cuál es
la idea.
Después que ha definido la hipótesis obviamente, debemos
establecer como obtener los datos por ejemplo si es secuenciar del
genoma, como voy aislar el genoma del organismo, qué método de usar ese método que estoy usando es compatible
con el método de secuenciamiento que voy a utilizar porque por ejemplo los métodos de extracción de ADN para
para ser utilizados para Illumina son distintos que los métodos de aislamiento extracción de ADN que van a ser
utilizados por ejemplo para Nanopore o para PackBio, entonces cada uno de ellos tiene no son muy diferentes pero
tienen sus puntos claves una vez que obtengan la data, lo tiene que limpiar la data por ejemplo si ustedes este están
secuenciando el genoma de un insecto que creen ustedes que es el vector de un virus es un vector nuevo de un
virus X entonces ustedes extraño el ADN del insecto que lo mandan a secuencia lo más probable es que en esa
secuencia que han mandado que obtienen ahí está también secuencias de bacterias, otros organismos que viven en
el interior del insecto que son parte del microbioma del insecto y también van a encontrar secuencias de bacterias
que ustedes tienen las manos, etcétera, ocurre eso es muy común la contaminación entonces tienen que limpiar los
datos tiene todo eso se hace mediante software ustedes simplemente eso lo hacen por Blast todo su genoma que
obtienen de la empresa que le que les hizo el servicio ustedes hacen blast con las bacterias y eliminar a todos los
que se parecen al 100%, pueden hacer contra la base de datos de [Link], de una bacteria que saben ustedes que vive
en el interior del insecto.
Después hace una exploración de los datos para ver cómo están qué tal están no la calidad un poco y luego ya hacen
los análisis que ustedes tiene planeado hacer para probar su hipótesis y luego comunicar los resultados.
Estas son las preguntas que hay que tener en cuenta al momento
de definir la hipótesis un cuento de experimentos verdad bueno
los datos de ese pensamiento al igual que cualquier otro dato que
ustedes obtienen al momento de leer el experimento hacer las
lecturas hacer entonces usualmente cuando hacen un
experimento de campo banco un formato verdad impreso en papel
van y toman datos por ejemplo de peso medida altura, esos datos
tienen que están distribuidos normalmente verdad tiene hay datos
que son atípicos todo eso ocurre también para secuenciamiento
no es ajeno a ese tipo de errores.
Y los datos nunca son perfectos también no nunca son perfectos
lo más importante es que sigan una tendencia, si ustedes por
ejemplo ven diferencias efectivamente en el plantas o en el
tratamiento que ustedes quieren probar la hipótesis pero lo más
probable es que esas diferencias están ahí comparadas con el
control o con el testigo, entonces simplemente lo que queda
después es someter a un análisis estadístico para ver si esas
diferencias son o no son significantes, eso ocurre también con
datos de secuenciamiento.