Machine learning para predicción de la estructura de la proteina
César Pantoja Rosales, Guillermo Suarez, Ling Long
Computational Intelligence Group, Departamento de Inteligencia Artificial, Universidad Politécnica de Madrid, Spain
Resumen
En este trabajo de visión de computador nos centramos en un análisis detallado del modelo AlphaFold
versión 1 y 2, como la estructura que tiene, los componentes que lo forman y también los resultados que
habı́an conseguido en el concurso CAPS en el problema de predicción de la estructura 3D de las proteı́nas
y problemas de plegamiento de proteı́nas.
1. Introducción
Las proteı́nas son los causantes de la gran mayorı́a de los procesos vitales a nivel celular. Llevan a cabo una
sin número de funciones como la catálisis de reacciones bioquı́micas, funciones mecánicas involucradas en la
motilidad celular, la formación de la arquitectura subcelular, entre muchas otras. Un paradigma central para
comprender su función se ha basado en la observación de la estructura del plegamiento de las proteı́nas en su
forma tridimensionales, las cuales son complejas pero especı́ficas que varı́an según su secuencia de aminoáci-
dos (Jendrusch et al., 2021). Sin embargo, mientras que Universal Protein Resource (UniProt) archiva casi
220 millones de secuencias de proteı́nas únicas, Protein Data Bank (PDB) contiene solo un poco más de 180
000 estructuras 3D de proteı́nas distintas, lo cuál limita severamente la cobertura de las distintas secuencias
de aminoácidos de este modo, lograr una mayor cobertura del espacio de secuencias con estructuras de alta
resolución determinadas, es muy laborioso. A menudo se requiere mucho ensayo y error, por ejemplo,el uso de
la técnica de cristalografı́a en la cual bajo condiciones adecuadas, se puede descubrir estructura de una pro-
teı́na. Una forma de mejorar ello es predecir las estructuras de millones de proteı́nas haciendo uso de técnicas
de inteligencia artificial (IA), como lo vienen haciendo ya varios cinétificos al dı́a de hoy y esto con lleva a
predecir computacionalmente la estructura de una proteı́na solamente a partir de su secuencia de aminoácidos .
AlphaFold es un sistema de inteligencia artificial desarrollado por DeepMind que realiza predicciones de última
generación de estructuras de proteı́nas a partir de sus secuencias de aminoácidos. En 2020, los organizadores del
benchmark CASP14 reconocieron a AlphaFold como una solución al problema de predicción de estructura de
proteı́nas (12) (Varadi et al., 2021) . Por tanto en este estado de arte trataremos de explicar y entender cómo
se usó las herramientas de machine learnig para realizar estos trabajos.
2. Estado del arte
2.1 Plegamiento de la Proteina:
Las proteı́nas tienen un papel importante en todos los organismos conocidos, ya que son macromoléculas
que llevan acabo funciones tales como la catálisis de reacciones quı́micas en el metabolismo, la regulación de
procesos celulares, el transporte de componentes intra y extracelulares, el movimiento a nivel tanto macro
como microscópico de los organismos y un largo etcétera. De este modo, estas macromoléculas son cadenas
lineales de aminoácidos unidos covalentemente a través de un enlace peptı́dico, ası́ mismo son sintetizadas
en la célula por los ribosomas que catalizan la formación de este enlace entre distintos aminoácidos en un
orden de acuerdo con la secuencia nucleotı́dica de un ARN mensajero. Ambas secuencias se encuentran
conectadas a través del código genético, que asocia a cada grupo de 3 nucleótidos consecutivos con algún
aminoácido. A su vez, la secuencia este ARN ha sido generada de acuerdo con la secuencia de un segmento
de ADN, vale decir, un gen. Para poder realizar sus funciones biológicas en un medio fisiológico las proteı́nas
deben adquirir una estructura tridimensional determinada: su ‘estructura nativa’. El proceso mediante el
cual ésta se alcanza se conoce como ‘plegamiento’. Entender cómo ocurre este proceso, conlleva a un
problema de gran importancia, no solo para la bioquı́mica básica, sino que también para aplicaciones tales
como la biomedicina, la industria y la farmacia. Por ejemplo, enfermedades neurodegenerativas tales como
1
el mal de Alzheimer y la enfermedad de Creutzfeldt-Jakob son causadas por la formación de agregados
proteicos producto del mal plegamiento de ciertas proteı́nas. (Vallejos-Baccelliere, 2022)
2.2 Concurso CAPS
En 1994 se realiza la primera versión de CAPS , un concurso bianual en donde diversos grupos de in-
vestigación ponen a prueba sus metodologı́as para predecir estructuras tridimensionales de proteı́nas. En
este concurso a cada participante se le otorga un conjunto de secuencias de proteı́nas cuya estructura ya
se ha determinado, pero que aún no se ha hecho pública. De esta forma, las predicciones realizadas por
cada equipo son evaluadas de acuerdo con su porcentaje de similitud respecto a ellas. Estas metodologı́as
son tres : la primera por homologı́a, esta consiste en utilizar como molde una proteı́na de estructura ya
conocı́da y la cual está presente en una secuencia de una proteı́na objetivo, entonces la idea principal en
la cuál se basa, es la idea de que la similitud entre secuencias implica similitud entre estructuras, para el
segundo modelo denominado threading, se basa en probar distintas clases estructurales hasta encontrar
la que mejor podrı́a servir de molde para enhebrar la secuencia aminoácida objetivo y por último mo-
delamiento ab initio, en cambio, prescinde del uso de moldes, las metodologı́as clásicas de este grupo se
basan en la búsqueda de los patrones estructurales más frecuentes para diversos segmentos con secuencias
determinadas, tales como tendencias a formar cierta estructura secundaria, ángulos entre enlaces, giros u
otros (Problemas contemporáneos en la filosofı́a de la bioquı́mica: (Vallejos-Baccelliere, 2022). Entre los
años 2002 y 2012, se produjo un estancamiento en los puntajes obtenidos por los participantes de CASP
principalmente porque habı́a una ‘saturación’ de metodologı́as y los avances se concentraban principal-
mente tanto en su optimización como refinamiento, además de la inclusión de nueva data estructural. En
el año 2014 se mejoró considerablemente ya que se implementó el deep learning, lo cuál aumentó consi-
derablemente la eficiencia en la extracción de patrones estructurales y de secuencia ası́ mismo también se
introdujo el análisis de correlación evolutiva entre residuos. Entonces durante el CASP14, desarrollado en
2020, el software Alphadold2, que involucraba ambas metodologı́as, derrotó con creces a todos los otros
participantes obteniendo récords nunca vistos en la predicción de estructuras. (Vallejos-Baccelliere, 2022)
2.3 AlphaFold
El funcionamiento de este nuevo algoritmo es complejo y contiene muchos sub-procesos, pero básicamente
se trata de una red neuronal con varios módulos entrenados con información estructural proveniente del
Protein Data Bank (PDB). Por otro lado, a partir de información de miles de secuencias provenientes de
bases de datos metagenómicos se extraen patrones de mutaciones correlacionadas entre proteı́nas homolo-
gas cercanas y lejanas a partir de los cuales se infieren posibles contactos entre residuos y sus distancias,
en lo que se conoce como un distograma. Con base en esto se genera un modelo tridimensional que pasa
por sucesivos procesos de refinamiento, de descarte de modelos fı́sicamente imposibles y varias iteraciones.
(Vallejos-Baccelliere, 2022)
2.3.1 AlphaFold versión 1
La primera versión tuvo como idea central el uso de redes neuronales convolucionales, la cuál fue
entrenada con estructuras de PBD para predecir las distancias dij entre los átomos Cβ de pares, ij,
de residuos de una proteı́na. Sobre la base de una representación de la secuencia de aminoácidos, S,
de una proteı́na y caracterı́sticas derivadas del MSA(S) (MSA identifica secuencias similares, pero
no idénticas, que se han identificado en organismos vivos. Esto permite determinar las partes de la
secuencia que tienen más probabilidades de mutar y nos permite detectar correlaciones entre ellas)
de la secuencia, la red, que es similar en estructura a las que se usan para tareas de reconocimiento
de imágenes, predice una probabilidad discreta de distribución P (dij |S, M SA(S)) para cada par ij
en cualquier región de 64X64 de la matriz de distancia LXL, como se muestra a continuación (Senior
et al., 2020):
2
AlphaFold desglosa el problema de predicción en dos pasos:
◦ El primer paso se formula como un problema de aprendizaje supervisado haciendo uso de una
red convolucional. Dada una Secuencia de aminoácidos se busca la estructura 3D de la proteı́na,
de este modo, se proporciona como entrada a la red información relacionada a la secuencia, y una
forma de extraer información de esta secuencia es haciendo el uso de MSA, el cuál consiste en
alinear y comparar muchas secuencias de aminoácidos de proteı́nas de distintos seres vivos, que
tienen una relación evolutiva y por ello su secuencia de aminoácidos es parecida. De esta forma
comparando muchas secuencias y viendo como coevolucionan los animoácidos, se puede conocer
qué interacción se produce dentro de la estructura tridimensional de la proteı́na que nos pueden
ayudar a predecir cómo se va a plegar. La información de cómo interactuan dos aminoácidos
que ocupan una posición diferente en la secuencia se puede estudiar con diferentes estadı́sticos,
como la correlación, el cuál nos permite ir complentando una matriz de datos que nos indique
cómo interactua cada aminoácido de la secuencia consigo mismo, de esta manera se formará una
matriz de datos que se parecerá a una imágen. (Senior et al., 2020)
3
Esta información será la que se sumistrará como entrada a alphaFold, es acá donde ingresan
las redes de neuronas convolucionales, lo que se pretende con ello, es generarar una imágen que
represente la estructura tridimensional de la proteı́na, entonces está será la salida de la red, un
distograma, el cuál representa la predicción que hizo la red de las distancias en la que se puede
encontrar cada aminoácidos de la secuencia dada como entrada. a continuación se muestra los
resultados de pruebas en el paper de alphaFold. (Senior et al., 2020)
◦ El segundo paso consiste en inferir la estructura 3D de la proteı́na a partir del distograma
obtenido en el paso anterior. En este paso se utiliza el descenso del gradiente, con el cuál poco a
poco se irá optimizando la estructura de la proteı́na para que esta se vaya plegando, optimizando
los ángulos de torsión para que ası́, la estructura de la proteı́na vaya haciendo que las distancias
entre aminoácidos se parezca a la predicha en la red neuronal. Uno puede imaginar que se trata
de “reinflar” una estructura aplanada.(Senior et al., 2020)
2.3.2 AlphaFold versión 2
Para esta versión se presentaron mejoras, haciendo uso de transformers, a continuación arquitectura
4
propuesta en esta segunda versión :
Esta nueva versión cuenta con tres partes principales :
◦ Para comenzar, esta versión utiliza la secuencia de aminoácidos de entrada para consultar varias
bases de datos de secuencias de proteı́nas y construye una alineación de secuencia múltiple
(MSA). Esto permite determinar las partes de la secuencia que tienen más probabilidades de
mutar y nos permite detectar correlaciones entre ellas, ası́ mismo intenta identificar proteı́nas
que pueden tener una estructura similar a la entrada y construye una representación inicial de
la estructura, a la que denomina representación de pares”. Este es, en esencia, un modelo de qué
aminoácidos es probable que estén en contacto entre sı́. (Jumper et al., 2021)
◦ Para la segunda parte del diagrama, toma la alineación de secuencia múltiple y las plantillas y las
pasa a través de un transformador, esto se puede entender como un .oráculo”que puede identificar
rápidamente qué piezas de información son más informativas. El objetivo de esta parte es refinar
las representaciones tanto para el MSA como para las interacciones de pares, pero también para
intercambiar información iterativamente entre ellos. Un mejor modelo de la MSA mejorará la
caracterización de la geometrı́a de la red, lo que simultáneamente ayudará a refinar el modelo
de la MSA. Este proceso está organizado en bloques que se repiten iterativamente hasta un
número determinado de ciclos (48 bloques en el modelo publicado). Esta información se lleva a
la última parte del diagrama: el módulo de estructura. Esta pieza sofisticada de la tuberı́a toma
la representación MSArefinada y la representación de pares las aprovecha para construir un
2
modelo tridimensional de la estructura. A diferencia de alphaFold versión 1, esta red no utiliza
ningún algoritmo de optimización, en su lugar genera una estructura final estática en un solo
paso. El resultado final es una larga lista de coordenadas cartesianas que representan la posición
de cada átomo de la proteı́na, incluidas las cadenas laterales.(Jumper et al., 2021)
◦ Una última pieza es que el modelo funciona iterativamente. Después de generar una estructura
final, tomará toda la información ( es decir , representación MSA, representación de pares y
estructura predicha) y la devolverá al comienzo de los bloques de Evoformer. Las innovaciones
en esta seccion de la red son particionar la cadena para permitir el refinamiento de todas las parte,
un transforme con el que la red razona sobre los atomos de la cadena lateral no representados
y una perdida del peso de los residuos. Este refinamiento iterativo contribuye notablemente a la
precisión con tiempos menores.(Jumper et al., 2021)
se detallará un poco más sobre esos módulos presentados en esta nueva versión:
◦ Preprocesamiento
Como la mayorı́a de los programas de bioinformática, AlphaFold 2 viene equipado con un ”pre-
processing pipeline”, que es la jerga de la disciplina para .a Bash script that calls some other
codes”. el pipeline ejecuta una serie de programas para consultar bases de datos y, utilizando la
secuencia de entrada, genera una alineación de secuencias múltiples (MSA) y una lista de tem-
plates. Cada programa tiene una secuencia de comandos ligeramente diferente, pero AlphaFold 2
no es muy diferente del pipeline de preprocesamiento de la predicción de estructura de proteı́na
.(Jumper et al., 2021)
◦ módulo Evoformer
El Evoformer, tiene la tarea de exprimir hasta la última gota de información de la alineación
de secuencias múltiples y los templates, la idea central detrás del Evoformer es que la informa-
ción fluya de un lado a otro a través de la red. En este módulo, la representación del par de
5
aminoácido, es tanto un producto como una capa intermedia . En cada ciclo, el modelo apro-
vecha la hipótesis estructural actual para mejorar la evaluación de la alineación de secuencias
múltiples, lo que a su vez conduce a una nueva hipótesis estructural, y ası́ sucesivamente. Ambas
representaciones, secuencia y estructura, intercambian información hasta que la red llega a una
inferencia sólida.(Jumper et al., 2021)
La arquitectura Evoformer utiliza no uno, sino dos transformadores con un canal de comunica-
ción clara entre los dos. Cada transformer está especializado para el tipo particular de datos que
está viendo, ya sea una alineación de secuencias múltiples o una representación de interacciones
por pares entre aminoácidos. Ası́ el transformador MSA calcula la atención sobre una matriz muy
grande de sı́mbolos de proteı́nas. Es decir, la red primero calcula la atención en la dirección hori-
zontal, lo que permite que la red identifique qué pares de aminoácidos están más relacionados; y
luego en la dirección vertical, determinando qué secuencias son más informativas. La caracterı́sti-
ca más importante del transformador MSA de AlphaFold 2 es que el mecanismo de atención por
filas (horizontal) incorpora información de la representación de pares”. Al calcular la atención, la
red agrega un término de sesgo que se calcula directamente a partir de la representación del par
actual. Este truco aumenta el mecanismo de atención y le permite identificar pares de residuos
que interactúan. El otro transformer, el cual actúa sobre la representación del par, funciona de
manera similar al anterior transformer explicado, aunque difieren muchos detalles, por supuesto.
La caracterı́stica clave de esta parte es que la atención se organiza en términos de triángulos de
residuos. La ide principal aquı́ es hacer cumplir la desigualdad triangular, uno de los axiomas de
los espacios métricos. Esta es una idea bastante inteligente, ya que uno de los problemas clásicos
de la predicción de estructuras basada en el aprendizaje profundo era que las distribuciones de
distancia no podı́an integrarse en el espacio tridimensional. Parece que este truco soluciona eso
y algo más.(Jumper et al., 2021)
◦ módulo estructura
El módulo de estructura opera en una estructura 3D utilizando la representación de pares y MSA.
Esta estructura 3D se representa como Nr es rotaciones y traslaciones independientes, las cuales
6
dan prioridad a la orientación del esqueleto de la proteı́na, por lo que la ubicación de la cadena
lateral de cada residuo depende de esta orientación. El módulo de estructura considera a la
proteı́na como un “gas residual”. Cada aminoácido se modela como un triángulo, que representa
los tres átomos de la columna vertebral. Estos triángulos flotan en el espacio y son movidos por
la red para formar la estructura. (Jumper et al., 2021)
La representación del gas residual se actualiza iterativamente en dos etapas:
1. Se utilizan mecanismos de atención denominados “atención puntual invariable(IPA)” para
actualizar Nres conjunto de activaciones neuronales sin cambiar las posiciones 3D.
2. Se actualiza de igual manera el gas residual utilizando las activaciones actualizadas. Con-
siguiendo que el valor final sea invariante a las rotaciones y transformaciones. Después de
cada operación de atención, se calcula una actualización de rotación y traslación.
Entrenamiento con datos etiquetados y no etiquetados
Podemos obtener buena precision usando solo aprendizaje supervisado en datos PDB, pero podemos
mejorar aún más la precisión utilizando un enfoque similiar a la autodestilación ruidosa del estudiante.
Se usó la red entrenada para predecir la estructura de diferentes secuencias y crear un nuevo conjunto
de datos de estructuras que luego utiliza en el entrenamiento con la misma arquitectura, desde cero
y junto con datos PBD. Este procedimiento hace posible el uso eficaz de los datos de secuencia no
etiquetados y mejora considerablemente la precisión.(Jumper et al., 2021)
En la gráfica podemos ver el fenómeno comentado anteriormente, donde vemos que sigue una tra-
yectoria suave después de las primeras iteraciones, lo que demuestra que AlphaFold realiza mejoras
incrementales constantes en la estructura. Para proteı́nas complejas la red tarda en estabilizarse, por
el contrario, para proteı́nas simples la red encontrará la estructura final en las primeras iteraciones.
7
3. Conclusiones e investigaciones futuras.
Las estructuras de las proteı́nas aportan información tanto para razonar sobre los procesos biológicos como
para posibilitar intervenciones, el 17 % del total de residuos de las secuencias de proteı́nas humanas está cubierto
por una estructura determinada experimentalmente.
La cobertura estructural del proteoma aplicando AlphaFold, a una escala que cubre casi todo el proteoma
humano (98,5 % de las proteı́nas humanas). El 58 %(pLDDT > 70) de todos los residuos de aminoácidos predichos
en el conjunto de datos alcanzaron niveles de confianza, con un 35,7 % que alcanzó un nivel de confianza alto.
Ya se han depositado más de 50.000 estructuras de proteı́nas humanas, en el Banco de Datos de Proteı́nas
(PDB). Aun ası́, sólo el 35 % de las proteı́nas humanas está contenida en PDB y, en muchos casos, la estructura
sólo abarca un fragmento de la secuencia.
La determinación de la estructura requiere superar muchos obstáculos, propiedades como el tamaño de la
proteı́na, la presencia de regiones transmembrana, la presencia de desorden o la susceptibilidad al cambio confor-
macional. La proteı́na debe producirse en cantidades suficientes y purificarse. Por ello, la cobertura estructural
completa del proteoma sigue siendo un reto pendiente.
A menudo pueden obtenerse buenos resultados incluso con proteı́nas complejas sin una estructura modelo en
el PDB, o con relativamente pocas secuencias relacionadas para construir un alineamiento múltiple de secuencias
(MSA).
La predicción de estructuras ha experimentado avances sustanciales en los últimos años, como demuestran
los resultados Critical Assessment of protein Structure Prediction (CASP). En concreto, la última versión
de AlphaFold se presentó en CASP14. Demostró una mejora considerable sobre los métodos anteriores. Las
predicciones de esqueleto con una desviación cuadrática media inferior a Ångström (Cα r.m.s.d.)
Para que las predicciones resultantes sean útiles en la práctica, deben venir acompañadas de una medida
de confianza bien calibrada. Para ello, AlphaFold produce una métrica de confianza por residuo denominada
prueba de diferencia de distancia local predicha (pLDDT) en una escala de 0 a 100. La pLDDT calcula el grado
de concordancia entre la predicción y una estructura experimental basándose en la prueba de diferencia de
distancia local Cα (lDDT-Cα).
8
pLDDT puede variar significativamente a lo largo de una cadena, permitiendo que el modelo exprese alta
confianza en los dominios estructurales, pero baja confianza en los enlaces entre los dominios estructurales.
Los investigadores presentan algunas pruebas de que las regiones con pLDDT bajo pueden ser aislados no
estructurados y regiones con pLDDT < 50 no debe ser interpretado, o interpretado como posibles predicciones
de desorden.
Consideraban que una predicción es muy precisa cuando, las cadenas laterales suelen estar correctamente
orientadas. Sobre esta base, pLDDT > 90 se toma como el corte de alta precisión. Un lı́mite inferior de pLDDT
> 70 corresponde a una predicción generalmente correcta del backbone.
A nivel de cada proteı́na, el 43,8 % de las proteı́nas tienen una predicción fiable en al menos tres cuartas
partes de su secuencia, mientras que 1.290 proteı́nas contienen una región sustancial (más de 200 residuos) con
pLDDT ≥ 70 y sin una buena plantilla.
El enfoque de cadena completa permite al modelo intentar una predicción de empaquetamiento entre do-
minios. Para seguir evaluando AlphaFold en proteı́nas multidominio largas, recopilamos un conjunto de datos
9
de prueba de cadenas PDB recientes que no estaban en el conjunto de entrenamiento del modelo. Sólo se in-
cluyeron cadenas con más de 800 residuos resueltos. El rendimiento en este conjunto se evaluó utilizando la
puntuación de modelado de plantillas (TM-score), que deberı́a reflejar mejor la precisión global. Los resultados
fueron alentadores, con un 70 % de predicciones con una puntuación TM > 0,7.
Calcularon después las puntuaciones TM para el proteoma humano, para identificar predicciones multido-
minio que pudieran presentar nuevos empaquetamientos de dominios. Los criterios aplicados fueron un pLDDT
> 70 en al menos 600 residuos que constituyeran más de la mitad de la secuencia, 187 proteı́nas tienen TM >
0,8 y 343 tienen TM > 0,7.
Además, hay una gran diferencia en la distribución de pLDDT entre residuos resueltos y no resueltos en
secuencias PDB.
10
La importancia del proteoma humano para la salud y la medicina, al proporcionar una predicción de estruc-
turas escalable y de gran precisión, AlphaFold podrı́a permitir un apasionante cambio hacia la bioinformática
estructural.
Referencias
Jendrusch, M., Korbel, J. O. & Sadiq, S. K. (2021). AlphaDesign: A de novo protein design framework based
on AlphaFold. biorxiv. [Link]
Jumper, J., Evans, R., Pritzel, A., Green, T., Figurnov, M., Ronneberger, O., Tunyasuvunakool, K., Bates, R.,
Žı́dek, A., Potapenko, A., Bridgland, A., Meyer, C., Kohl, S. A. A., Ballard, A. J., Cowie, A., Romera-
Paredes, B., Nikolov, S., Jain, R., Adler, J., . . . Hassabis, D. (2021). Highly accurate protein structure
prediction with AlphaFold. Nature, 596(7873), 583-589. [Link]
Senior, A. W., Evans, R., Jumper, J., Kirkpatrick, J., Sifre, L., Green, T., Qin, C., Žı́dek, A., Nelson, A. W.
R., Bridgland, A., Penedones, H., Petersen, S., Simonyan, K., Crossan, S., Kohli, P., Jones, D. T., Silver,
D., Kavukcuoglu, K. & Hassabis, D. (2020). Improved protein structure prediction using potentials from
deep learning. Nature, 577(7792), 706-710. [Link]
Vallejos-Baccelliere. (2022). Problemas contemporáneos en la filosofı́a de la bioquı́mica: lecciones desde el ple-
gamiento de proteı́nas y el problema in-vitro/in-vivo. Revista Culturas Cientı́ficas, Vol.3.
Varadi, M., Anyango, S., Deshpande, M., Nair, S., Natassia, C., Yordanova, G., Yuan, D., Stroe, O., Wood, G.,
Laydon, A., Žı́dek, A., Green, T., Tunyasuvunakool, K., Petersen, S., Jumper, J., Clancy, E., Green, R.,
Vora, A., Lutfi, M., . . . Velankar, S. (2021). AlphaFold Protein Structure Database: massively expanding
the structural coverage of protein-sequence space with high-accuracy models. Nucleic Acids Research,
50(D1), D439-D444. [Link]
11