Predicción de Estructuras de Proteínas
Predicción de Estructuras de Proteínas
OBJETIVOS:
• Se determinará el dominio de una secuencia de proteínas descargada de Uniprot.
• Se predecirá la estructura secundaria de la secuencia de proteína descargada de Uniprot.
• Se predecirá la estructura terciaria de la proteína, también se validará y refinará hasta obtener una estructura aceptable.
IMPORTANCIA:
Los motivos, dominios y la predicción de estructuras de proteínas son aspectos esenciales en el estudio de las proteínas. Comprender los motivos y dominios nos proporciona
información crucial sobre la función y la actividad biológica de las proteínas, permitiéndonos clasificarlas y agruparlas en categorías funcionales. Estos elementos también guían
el diseño de experimentos y estudios funcionales para investigar cómo los motivos y dominios afectan la actividad de las proteínas. Por otro lado, la predicción de estructuras de
proteínas basada en motivos y dominios nos brinda información valiosa sobre la arquitectura tridimensional de las proteínas, su estabilidad y sus interacciones, lo cual es esencial
para comprender su función y su potencial en aplicaciones terapéuticas y en el diseño de fármacos. En conjunto, los motivos, dominios y la predicción de estructuras de proteínas
nos proporcionan una comprensión más completa y detallada de las proteínas y su papel en los procesos biológicos.
Parte 1: Determinación de Dominios Proteicos:
Figura 1. Buscar y elegir una proteína mediante Uniprot.
Agregar secuencia
descargada en formato fasta.
Descripción: A excepción de la proteína de competencia, estas proteínas se unen a dos iones de zinc por molécula como cofactor.
No se observa familia
Mismo dominio, pero diferente nombre en las bases de dato: Pfam, Interpro, smart
Dominio: Metalo-B-lactamasa / Lactamasa_B_5a / Lactamasa_B
Parte 2: Predicción de Estructuras secundarias de Proteínas
Se eligió Psi-Pred:
• Psi-Pred está específicamente diseñado para la predicción de estructuras secundarias y utiliza algoritmos de aprendizaje automático basados en perfiles de secuencia. Es
eficaz en la predicción de estructuras secundarias, especialmente en regiones altamente conservadas de las proteínas. Utiliza información de perfiles de secuencia, que
son matrices que representan las frecuencias relativas de cada aminoácido en diferentes posiciones de alineamientos de secuencia de proteínas homólogas. Tiene un
enfoque de algoritmos de aprendizaje automático que le permite aprender patrones y características de secuencia que están asociados con diferentes tipos de estructuras
secundarias, lo que mejora su capacidad para realizar predicciones precisas. Además, Psi-Pred se ha actualizado y mejorado a lo largo del tiempo, utilizando enfoques
más avanzados y datos actualizados para mejorar su rendimiento.
Figura 9. Colocar la secuencia query en formato fasta en la herramienta Psi-Pred y esperar resultados
• Ensamblaje de fragmentos: Robetta también emplea el método de ensamblaje de fragmentos, que consiste en dividir la secuencia de la proteína en fragmentos más cortos
(generalmente de 3 a 9 residuos) y buscar estructuras conocidas en la base de datos PDB que se asemejen a estos fragmentos. Luego, los fragmentos se ensamblan para
construir una estructura tridimensional completa de la proteína objetivo. Esta técnica aprovecha la conservación de las estructuras locales en las proteínas.
• Optimización energética: Una vez que se generan los modelos de estructuras tridimensionales, Robetta utiliza métodos de optimización energética para refinar y mejorar
estas estructuras. Esto implica realizar cálculos de energía y ajustes en los ángulos y distancias entre los átomos de la proteína para minimizar la energía y mejorar la
estabilidad de la estructura.
Figura 12. Crear cuenta en Robetta
Figura 13. Colocar secuencia fasta en la herramienta Robetta y configurar, además esperar al resultado
• Se obtuvieron 5 modelos de proteínas con un gráfico que representa el error estimado en angstroms.
Figura 15. Comparación de modelos de proteínas con gráficos que representan el error estimado en angstroms, obtenido de Robetta.
Figura 16.A. Comparación de modelos de proteínas con gráficos que representan el error estimado en angstroms, obtenido de Robetta.
Figura 16.B. Comparación de modelos de proteínas con gráficos que representan el error estimado en angstroms, obtenido de Robetta.
Muestra la distribución del error estimado en angstroms para cada posición de residuo en la secuencia de la proteína. Proporciona una visualización de la precisión de la predicción
de estructura tridimensional en función de la posición de los residuos.
En el eje X del gráfico, se representa la posición de los residuos en la secuencia de la proteína, mientras que en el eje Y se muestra el error estimado en angstroms para cada
posición. El error estimado en angstroms indica cuán cerca o lejos está la predicción de la estructura tridimensional de cada residuo con respecto a la estructura real o de
referencia.
• En los modelos terciarios de proteínas de puede observar estructuras secundarias, como; beta hoja plegada, alfa hélice, turn y coils.
Figura 17. Elegir un modelo de proteína mediante los resultados de Robetta y descargar estructura en PDB.
En vez de emplear Rasmin para determinar las cadenas presentes en la proteína, se empleó PyMol. Si había más de una cadena, se eliminaría
hasta quedar una, si había solo una cadena y se le aplica el comando se eliminaría todo. Así se detectaría si había una cadena.
Figura 20. Eliminar una cadena de la estructura terciaria mediante la herramienta PyMol
Solo ahi una cadena, por lo que se eliminó todos los 4311 átomos
Alfa hélice
Coils
Turns
Figura 23. Descargar la estructura terciaria de la proteína de la herramienta PyMol en formato PDB para seguir procesándola
Igualmente, se guardó la estructura de pymol aunque no fue necesario utilizar la herramienta porque no había varias cadenas, solo había una. Se colocó el comando para guardar
la estructura.
VALIDAR ESTRUCTURA 3D DE LA PROTEÍNA Metalo-beta-lactamasa L1 tipo 3
Figura 24. Cargar la estructura terciaria en formato PDB de Robetta en el programa SAVES v6.0
Figura 25. Se procedió a emplear la herramienta PROCHECK para validar la estructura
Cargando ……………
• El objetivo de PROCHECK es evaluar cuán normal, o por el contrario cuán inusual, es la geometría de los residuos en una estructura de proteína, en comparación con los
parámetros estereoquímicos derivados de estructuras bien refinadas y de alta resolución.
• Las regiones inusuales resaltadas por PROCHECK no son necesariamente errores como tales, sino que pueden ser características inusuales para las que existe una
explicación razonable (por ejemplo: distorsiones debidas a la unión de ligandos en el sitio activo de la proteína). Sin embargo, son regiones que deben revisarse
cuidadosamente.
Figura 26. Resultado de la herramienta PROCHECK del programa SAVES v6.0
• Amarillo=alerta
• Verde = paso
• Rojo = error
Hay 2 errores, no se puede aceptar.
Ambos gráficos de Ramachandran Plot y Side-Chain parameters mediante PROCHECK se denotan por error. En el gráfico de Ramachandra hay muchos
puntos en la región desfavorable, esto puede indicar problemas estructurales, inclusive ahí puntos en la zona blanca, indicando estructuras menos definidas.
En el gráfico de Side-Chain los aminoácidos no están cerca de la línea lateral, están fuera, esto indica que la estructura aún debe mejorar.
REFINAR MODELO DE LA ESTRUCTURA 3D DE LA PROTEÍNA Metalo-beta-lactamasa L1 tipo 3
Figura 29. Colocar la estructura proteica obtenida de Robetta en formato PDB en GalaxyWEB
Figura 30. Resultado del refinamiento en GalaxyWEB
• GDT-HA (Global Distance Test - High Accuracy): Es una medida que evalúa la similitud estructural entre dos proteínas. Cuanto mayor sea el valor del GDT-HA, mayor
será la similitud estructural entre las estructuras comparadas.
• RMSD (Root Mean Square Deviation): Es una medida de la diferencia promedio entre los átomos de una estructura proteica y los átomos correspondientes en otra
estructura de referencia. Un valor bajo de RMSD indica una alta similitud estructural entre las proteínas comparadas.
• MolProbity: Es una herramienta utilizada para evaluar la calidad de una estructura proteica. Proporciona información sobre la geometría, la energía y la estereoquímica
de la estructura. MolProbity se utiliza para identificar problemas estructurales como choques estéricos y desviaciones de geometría.
• Clash score: Es una medida que indica la cantidad de choques estéricos presentes en una estructura proteica. Los choques estéricos ocurren cuando los átomos se
acercan demasiado entre sí y generan repulsiones electrostáticas.
• Poor rotamers: Se refiere a la presencia de conformaciones de aminoácidos que no se ajustan adecuadamente a la geometría esperada. Los rotámeros pobres pueden
indicar una falta de ajuste de los aminoácidos en la estructura proteica.
• Rama favored: Se refiere a la conformación de los enlaces peptídicos en la estructura proteica. Indica si los enlaces peptídicos tienen una conformación favorable en
términos de torsiones y ángulos esperados. Los enlaces peptídicos en conformación "Rama favored" son más estables desde el punto de vista estructural.
Se eligió el MODELO 1, porque los resultados son mejores que otros modelos, el parámetro GDT-HA es más cercano a 1.0000,
Rama favored tiene valor mayor. El resto de parámetros deben de dar valores menores para que la estructura sea mejor, el
MODELO 1 para los parámetros restantes presenta resultados inferiores.
Figura 32. Resultado del refinamiento en GalaxyWEB: estructura de la proteína, del MODELO 1
Se observan en la figura estructuras como: alfa hélice, beta hoja plegada, coils
y turns.
Figura 33. Colocar la estructura proteica en formato PDB en el programa 3Drefine
Se busco emplear ambos programas: 3DRefine y GalaxyWeb, para refinar la estructura de proteína
y así tener más posibilidad de que esta estructura sea validada mediante el programa SAVE.
Figura 34. Observar resultados del programa 3Drefine: parámetros
Se observan en la figura estructuras como: alfa hélice, beta hoja plegada, coils
y turns.
Figura 36. El modelo 1 tanto de 3DRefine como de GalaxyWeb se descargan en formato PDB
No se toma en cuenta el resultado del refinamiento por 3DRefine porque cuando se valida, esta estructura para los diferentes
parámetros da como resultado muchos errores.
Figura 38. Validación del modelo descargado de GalaxyWeb
Se toma en cuenta el resultado del refinamiento por GalaxyWeb porque cuando se valida, esta estructura para los diferentes
parámetros da como resultado menos errores que por 3Drefine. Pero aun tiene errores, se sigue refinando la estructura.
SEGUNDO REFINAMIENTO
Figura 39. Segundo refinamiento del modelo de proteína por GalaxyWeb, resultado y descargar un modelo
Se trabaja mejor con GalaxyWeb porque 3Drefine da como resultado estructuras que cuando se verifican obtienen mucho margen de error
VALIDACIÓN DEL SEGUNDO REFINAMIENTO
Figura 40. Segunda validación del modelo de proteína por GalaxyWeb, resultado y descargar un modelo
ALFA HELICE
TURNS
COILS
El Ramachandran Plot es una representación gráfica que muestra las distribuciones de los ángulos dihedros phi (Φ) y psi (Ψ) en una estructura de proteína. Estos ángulos dihedros
definen la conformación de los enlaces peptídicos en una cadena polipeptídica.
El análisis del Ramachandran Plot es una forma útil de evaluar la calidad y la validez de una estructura proteica. Una alta proporción de puntos en la región permitida indica una
estructura bien ajustada y de alta calidad, mientras que una alta proporción de puntos en la región desfavorable puede indicar problemas estructurales o errores en la estructura. Se
utiliza para evaluar la conformación de los enlaces peptídicos en una estructura de proteína y proporcionar información sobre su calidad y validez estructural. Esto ayuda a los
investigadores a identificar y corregir posibles problemas o errores en la estructura proteica analizada.
Los colores:
• Rojo: Estas regiones están asociadas con las conformaciones más frecuentes y permitidas. Los ángulos dihedros Φ y Ψ que caen en estas regiones son consistentes con
las estructuras secundarias bien definidas, como las hélices α y las láminas β.
• Amarillo: Estas regiones indican conformaciones menos frecuentes, pero aún permitidas. Los ángulos dihedros Φ y Ψ que caen en estas regiones pueden representar
conformaciones ligeramente distorsionadas de las estructuras secundarias, o conformaciones menos comunes pero estables.
• Blanco: Estas regiones indican áreas de baja densidad de puntos. Los ángulos dihedros Φ y Ψ que caen en estas regiones son menos frecuentes y pueden corresponder
a conformaciones menos estables o estructuras menos definidas.
Hay más puntos en una región permitida, denotada por color rojo. Indica que la estructura esta ajustada y con calidad.
Figura 45. Analizar resultados de las herramientas del programa SAVE: All-residue Ramachandran
El Ramachandran Plot para todos los residuos es similar al Ramachandran Plot tradicional, pero en lugar de
representar solo algunos residuos específicos, muestra todos los residuos presentes en la estructura proteica.
En cada grafico de aminoácidos, las regiones de color verde son consistentes con estructuras secundarias
definidas.
Figura 46. Analizar resultados de las herramientas del programa SAVE: Chi1-Chi2 plots
Los Chi1-Chi2 plots son gráficos bidimensionales que representan los ángulos dihedros Chi1 y Chi2 de los aminoácidos en una estructura de proteína. Los gráficos de Chi1-Chi2
muestran las combinaciones de ángulos de torsión de la cadena lateral chi1-chi2 para todos los tipos de residuos cuyas cadenas laterales son lo suficientemente largas como para
tener ambos ángulos.
El sombreado de cada gráfico indica qué tan favorable es cada región del gráfico; cuanto más oscura es la sombra, más favorable es la región. Los datos en los que se basa el
sombreado provienen de un conjunto de datos de 163 cadenas de proteínas de alta resolución no homólogas elegidas de estructuras resueltas por cristalografía de rayos X a una
resolución de 2,0 Å o mejor y un factor R no mayor que 20 %
Los números entre paréntesis, después de cada nombre de residuo, muestran el número total de puntos de datos en ese gráfico. Los cuadrados rojos muestran aquellos residuos
que se encuentran en regiones desfavorables de la parcela.
Según los gráficos para cada residuo la mayoría de los cuadrados se encuentran en regiones permitidas y corresponden a las conformaciones esperadas para los átomos
laterales de los aminoácidos, la estructura muestra una conformación adecuada. Sin embargo, existen pocos residuos que tienen cuadrados rojos en regiones desfavorables,
presentan conformaciones inusuales en la estructura.
Figura 47. Analizar resultados de las herramientas del programa SAVE: Side-chain parameters
EJEMPLO N°02:
Se ha desarrollado un enfoque teórico efectivo para estudiar las propiedades de fase de las proteínas globulares, centrándose en particular en la mioglobina. En lugar de analizar
las interacciones entre átomos individuales o centros de interacción específicos, este enfoque se basa en la estructura terciaria de la proteína. Para ilustrar esto, se construyó
un diagrama de fase de la mioglobina (apo) utilizando la temperatura (T) y la acidez (pH) como variables termodinámicas. Se observó que la mioglobina se despliega desde su
estado plegado nativo hacia una estructura helicoidal aleatoria a medida que aumenta la temperatura y la acidez. Se confirmó la existencia de dos estados intermedios de
plegamiento, conocidos como glóbulos fundidos, y se predijo una transición abrupta entre estos estados cuando cambia la acidez. A medida que la temperatura aumenta cerca
de los 80 °C, se encontró que la línea de transición entre los dos estados de glóbulos fundidos termina en un punto tricrítico, donde las estructuras helicoidales desaparecen.
Los resultados también sugieren que los movimientos colectivos a gran escala desestabilizan la hélice F de la mioglobina, lo que impulsa la entrada y salida del ligando (2).
Estos hallazgos demuestran que las teorías efectivas que modelan la estructura terciaria de la proteína pueden ser un enfoque computacional válido para investigar la estructura
de fase de proteínas globulares complejas.
EJEMPLO N°03:
El método de predicción de estructura trRosetta en CASP14 se mejoró utilizando incrustaciones de modelos de lenguaje e información de plantilla ponderada. Se desarrolló un
proceso de refinamiento combinando trRosetta sin plantillas y trRosetta utilizando plantillas, guiados por DeepAccNet. Los resultados demostraron mejoras significativas en
comparación con el método original, siendo más rápido y requiriendo menos recursos computacionales, completando todo el proceso de modelado en un tiempo medio inferior
a 3 horas. El programa Rosetta se utilizó para el refinamiento de alta resolución, se mejoró los resultados principalmente al identificar secuencias homólogas adicionales para
introducir en la red y al usar el predictor de precisión DeepAccNet para guiar el refinamiento (3).
El método mejorado de trRosetta ofrece una herramienta eficaz y eficiente para predecir estructuras tridimensionales de proteínas, con tiempos de ejecución más rápidos, menor
consumo de recursos computacionales y resultados más precisos. Esto tiene aplicaciones importantes en el estudio de la estructura y función de las proteínas, lo que a su vez
contribuye al avance de la investigación biomédica y farmacéutica.
CONCLUSIONES:
• Se determinó que el dominio de la proteína es expresado con diferentes nombres, pero es el mismo: Metalo-B-lactamasa / Lactamasa_B_5a / Lactamasa_B.
• Se predijo la estructura secundaria de la secuencia de proteína descargada de Uniprot mediante Psi-Pred.
• Se predijo la estructura terciaria de la proteína mediante Robetta; también se validó y refinó mediante SAVES v6.0 y GalaxyWeb respectivamente, hasta obtener una
estructura aceptable.
REFERENCIAS:
1. Lawrence MC. Understanding insulin and its receptor from their three-dimensional structures. Mol Metab. 2021;52:101255. doi: 10.1016/[Link].2021.101255.
2. Begun A, Molochkov A, Niemi AJ. Protein tertiary structure and the myoglobin phase diagram. Sci Rep. 2019;9(1):10819. doi: 10.1038/s41598-019-47317-y.
3. Anishchenko I, Baek M, Park H, Hiranuma N, Kim DE, Dauparas J, et al. Protein tertiary structure prediction and refinement using deep learning and Rosetta in
CASP14. Proteins. 2021;89(12):1722-1733. doi: 10.1002/prot.26194.