Un estudio sobre cambios conformacionales de proteínas utilizando una estrategia de aprendizaje profundo aumentado de muestreo biofísico a gran escala

Predecir cambios conformacionales de proteínas sigue siendo un desafío crucial en biología computacional e inteligencia artificial. Los avances logrados mediante el aprendizaje profundo, como AlphaFold2, han movido el objetivo de predecir estructuras estáticas, pero no abordan el cambio conformacional dinámico que emprenden la mayoría de las proteínas para ejercer sus funciones biológicas. Estas transiciones son fundamentales para comprender una amplia gama de procesos biológicos, desde la actividad enzimática hasta la transducción de señales. Sin embargo, la falta de datos estructurales para los estados intermedios dificulta la predicción de estas transiciones. Además, los modelos existentes adolecen de altas barreras de energía libre de los estados en transición, lo que hace que las predicciones precisas sean aún más difíciles. Catalizador para el avance de una variedad de campos, incluido el diseño de fármacos, la biología sintética y la investigación de enfermedades, será el

Los modelos existentes para describir las transiciones conformacionales de proteínas incluyen análisis de modo normal basado en redes elásticas, así como modelos híbridos que combinan redes elásticas con simulaciones de dinámica molecular. Estos métodos son apropiados para movimientos conformacionales bastante simples, pero no tienen la resolución para explicar los cambios complejos y vastos que se encuentran en proteínas más grandes. Más recientemente, se han desarrollado enfoques de aprendizaje profundo, como codificadores automáticos, generadores de Boltzmann y modelos de difusión, que mapean estructuras de proteínas en espacios latentes de baja dimensión. Sin embargo, estos modelos dependen de una ruta lineal entre dos estados, que no se aplica en transiciones complejas y no lineales, como el cambio de pliegue. Más importante aún, las altas demandas de datos y la baja eficiencia de los datos, además de un costo computacional que excluye aplicaciones escalables en tiempo real, hacen que estos enfoques en sí mismos sean insatisfactorios.

Los autores detallan una nueva estrategia de aprendizaje profundo mediante el uso de muestreo biofísico de alto rendimiento para evitar la escasez de datos relacionados con la transición conformacional de proteínas. Las simulaciones de dinámica molecular se combinaron con métodos de muestreo mejorados para producir una biblioteca de 2635 proteínas con dos estados determinados experimentalmente. Este conjunto de datos utiliza un modelo general de aprendizaje profundo llamado PATHpre que predice vías estructurales que dan como resultado transiciones conformacionales con alta precisión. Fundamentalmente, la innovación del módulo HESpre en PATHpre se refiere al rendimiento predictivo del estado de alta energía a lo largo de la vía de transición. El modelo propuesto no hace suposiciones de espacio latente lineal que puedan ser objeto de crítica. Presenta una inmensa generalización hacia proteínas de diversas conformaciones. Eso significaría una gran contribución si aborda el modelado de comportamiento dinámico dentro de sistemas complejos, aplicando escalabilidad y eficiencia de datos a un nivel de enfoque.

En un enfoque PATHpre, se aplican matrices de distancia en un sistema de dos estados de conformación mediante la predicción de una red neuronal convolucional para adquirir un estado de alta energía entre dichos estados conformacionales; ahí es donde HESpre se detiene: solo los contactos especiales o únicos que determina que tienen lugar en alta energía del par de residuos a través de cada vía, basándose en la matriz de distancia por pares cuantifica la formación y ruptura de contactos para la vía tomada y la matriz de contacto general establecida. Contiene cuatro clases de proteínas MS clasificadas que representan movimientos entre dominios e intradominios, despliegues localizados y cambios de pliegue globales en sus propiedades conformacionales. Se realizó una validación cruzada de varias proteínas para el modelo, que logró fuertes correlaciones de Pearson y errores absolutos medios bajos en todos los pasos; por lo tanto, es muy versátil en todas las clases estructurales. El buen desempeño generalmente establece la aplicabilidad general del modelo en proteínas de diferentes longitudes de secuencia y complejidades de estructuras.

PATHpre es preciso en las predicciones muy altas de las vías de transición de proteínas al mostrar fuertes correlaciones con los datos experimentales y simulados que existen en una variedad de proteínas. Las evaluaciones también mostraron que PATHpre captura de manera sólida cambios conformacionales simples a complejos y es consistente con diferentes longitudes de secuencia, así como con la complejidad estructural. Es importante destacar que predijo con precisión las vías de transición para proteínas individuales, como la adenilato quinasa y la proteína ribosómica S7 30S, al hacer coincidir los paisajes experimentales de energía libre y funcionó mejor que los enfoques híbridos convencionales en condiciones desafiantes. Las predicciones de PATHpre se alinearon con las estructuras conocidas, y su mapeo de estados intermedios finos en proteínas de cambio de pliegue confirmó su amplia aplicabilidad y confiabilidad para capturar el amplio espectro de transiciones conformacionales de proteínas.

Este trabajo marca un progreso significativo en el modelado de proteínas impulsado por IA, proporcionando un enfoque escalable y eficiente en datos para predecir las transiciones conformacionales de las proteínas. La integración del muestreo biofísico a gran escala con el aprendizaje profundo en PATHpre aborda el desafío más estricto de los datos limitados y captura transiciones no lineales en la diversidad de proteínas. De hecho, este modelo generalizable constituirá la base para una aplicación enormemente mejorada de las aplicaciones de IA en biología computacional, estableciendo así una poderosa herramienta para investigar el comportamiento dinámico de las proteínas en una variedad de contextos, desde el descubrimiento de fármacos hasta la biología sintética.


Mira el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de telegramas y LinkedIn Grarriba. Si te gusta nuestro trabajo, te encantará nuestro hoja informativa.. No olvides unirte a nuestro SubReddit de más de 55.000 ml.

[Sponsorship Opportunity with us] Promocione su investigación/producto/seminario web con más de 1 millón de lectores mensuales y más de 500.000 miembros de la comunidad


Aswin AK es pasante de consultoría en MarkTechPost. Está cursando su doble titulación en el Instituto Indio de Tecnología de Kharagpur. Le apasiona la ciencia de datos y el aprendizaje automático, y aporta una sólida formación académica y experiencia práctica en la resolución de desafíos interdisciplinarios de la vida real.