Permitir la predicción de la estructura de proteínas de alta precisión a escala del proteoma

El método AlphaFold

Muchas innovaciones novedosas en aprendizaje automático contribuyen al nivel actual de precisión de AlphaFold. A continuación ofrecemos una descripción general de alto nivel del sistema; para obtener una descripción técnica de la arquitectura de red, consulte nuestro AlphaFold métodos de papel y especialmente su amplia Información Complementaria.

La red AlphaFold consta de dos etapas principales. La etapa 1 toma como entrada la secuencia de aminoácidos y un alineamiento de secuencia múltiple (MSA). Su objetivo es aprender una rica “representación por pares” que sea informativa sobre qué pares de residuos están cerca en el espacio 3D.

La etapa 2 utiliza esta representación para producir directamente coordenadas atómicas al tratar cada residuo como un objeto separado, prediciendo la rotación y traslación necesarias para colocar cada residuo y, en última instancia, ensamblando una cadena estructurada. El diseño de la red se basa en nuestras intuiciones sobre la física y la geometría de las proteínas, por ejemplo, en la forma de las actualizaciones aplicadas y en la elección de la pérdida.

Curiosamente, podemos producir una estructura 3D basada en la representación en capas intermedias de la red. Los vídeos de “trayectoria” resultantes muestran cómo la creencia de AlphaFold sobre la estructura correcta se desarrolla durante la inferencia, capa por capa. Normalmente, una hipótesis surge después de las primeras capas seguidas de un largo proceso de refinamiento, aunque algunos objetivos requieren toda la profundidad de la red para llegar a una buena predicción.

La estructura prevista para CASP14 apunta a T1044, T1024 y T1064 en capas sucesivas de la red. Las estructuras están coloreadas por número de residuo y el contador muestra la capa actual.

Precisión y confianza

AlphaFold fue evaluado rigurosamente en el CASP14 experimento, en el que los participantes predicen ciegamente estructuras de proteínas que han sido resueltas pero que aún no se han hecho públicas. El método logró una alta precisión en la mayoría de los casos, con un promedio de 95 % de RMSD-Cα para la estructura experimental de menos de 1 Å. En nuestros artículos, evaluamos más a fondo el modelo en un conjunto mucho más grande de entradas recientes del PDB. Entre los hallazgos se encuentran un sólido rendimiento en proteínas grandes y una buena precisión de la cadena lateral donde se predice bien la columna vertebral.

Precisión CASP14 de AlphaFold en relación con otros métodos. RMSD-Cα basado en el 95 % de los residuos mejor predichos para cada objetivo.

Un factor importante en la utilidad de las predicciones estructurales es la calidad de las medidas de confianza asociadas. ¿Puede el modelo identificar las partes de su predicción que probablemente sean confiables? Hemos desarrollado dos medidas de confianza además de la red AlphaFold para abordar esta pregunta.

El primero es pLDDT (lDDT-Cα previsto), una medida de confianza local por residuo en una escala de 0 a 100. pLDDT puede variar drásticamente a lo largo de una cadena, lo que permite que el modelo exprese una alta confianza en dominios estructurados pero una baja confianza en los enlaces entre ellos, por ejemplo. En nuestro papel, presentamos evidencia de que algunas regiones con pLDDT bajo pueden no estar estructuradas de forma aislada; ya sea intrínsecamente desordenado o estructurado sólo en el contexto de un complejo mayor. Las regiones con pLDDT <50 no deben interpretarse excepto como una posible predicción de trastorno.

La segunda métrica es PAE (Error alineado previsto), que informa el error de posición esperado de AlphaFold en el residuo x, cuando las estructuras previstas y verdaderas están alineadas en el residuo y. Esto es útil para evaluar la confianza en las características globales, especialmente el empaquetado de dominios. Para los residuos xey extraídos de dos dominios diferentes, un PAE consistentemente bajo en (x, y) sugiere que AlphaFold confía en las posiciones relativas de los dominios. Un PAE consistentemente alto en (x, y) sugiere que las posiciones relativas de los dominios no deben interpretarse. El enfoque general utilizado para producir PAE se puede adaptar para predecir una variedad de métricas basadas en superposición, que incluyen puntuación TM y GDT.

Confianza por residuo (pLDDT) y error alineado previsto (PAE) para dos proteínas de ejemplo (P54725, Q5VSL9). Ambos tienen dominios individuales seguros, pero el último también tiene posiciones de dominio relativas seguras. Nota: Q5VSL9 se resolvió después de que se produjo esta predicción.

Para enfatizar, los modelos AlphaFold son, en última instancia, predicciones: aunque a menudo son muy precisos, a veces serán erróneos. Las coordenadas atómicas previstas deben interpretarse cuidadosamente y en el contexto de estas medidas de confianza.

Fuente abierta

Junto a nuestro papel metodohemos puesto a disposición el código fuente de AlphaFold en GitHub. Esto incluye acceso a un modelo entrenado y un script para hacer predicciones sobre secuencias de entrada novedosas. Creemos que este es un paso importante que permitirá a la comunidad utilizar y aprovechar nuestro trabajo. La forma más sencilla de plegar una única proteína nueva con AlphaFold es utilizar nuestro .

El código fuente abierto es una versión actualizada de nuestro sistema CASP14 basado en el Marco JAX, y logra una precisión igualmente alta. También incorpora algunas mejoras de rendimiento recientes. La velocidad de AlphaFold siempre ha dependido en gran medida de la longitud de la secuencia de entrada: las proteínas cortas tardan minutos en procesarse y solo las proteínas muy largas tardan horas. Una vez que se ha ensamblado el MSA, la versión de código abierto ahora puede predecir la estructura de una proteína de 400 residuos en poco más de un minuto de tiempo de GPU en un V100.

Escala de proteoma y AlphaFold DB

Los rápidos tiempos de inferencia de AlphaFold permiten que el método se aplique a escala de proteoma completo. En nuestro papel, discutimos las predicciones de AlphaFold para el proteoma humano. Sin embargo, desde entonces hemos generado predicciones para los proteomas de referencia de varios Organismos modelo, patógenos y especies económicamente significativas., y la predicción a gran escala ahora es una rutina. Curiosamente, observamos una diferencia en la distribución de pLDDT entre especies, generalmente con una mayor confianza en bacterias y arqueas y una menor confianza en eucariotas, lo que suponemos que puede estar relacionado con la prevalencia del desorden en estos proteomas.

Ningún grupo de investigación puede explorar por completo un conjunto de datos tan grande, por lo que nos asociamos con EMBL-EBI hacer que las predicciones estén disponibles gratuitamente a través del Base de datos AlphaFold. Cada predicción se puede ver junto con las métricas de confianza descritas anteriormente. También se proporciona una descarga masiva para cada especie, y todos los datos están cubiertos por una licencia CC-BY-4.0 (lo que los hace disponibles gratuitamente para uso académico y comercial). Estamos extremadamente agradecidos con EMBL-EBI por su trabajo con nosotros para desarrollar este nuevo recurso. En el transcurso de los próximos meses planeamos ampliar el conjunto de datos para cubrir los más de 100 millones de proteínas en UniRef90.

Ejemplo: predicciones de AlphaFold DB de una variedad de organismos.
Distribución de la confianza por residuo para 14 especies; De izquierda a derecha: bacterias/arqueas, animales y protistas.

En AlphaFold DB, hemos elegido compartir predicciones de cadenas de proteínas completas de hasta 2700 aminoácidos de longitud, en lugar de recortarlas en dominios individuales. La razón es que esto evita perder regiones estructuradas que aún no se han anotado. También proporciona contexto a partir de la secuencia completa de aminoácidos y permite que el modelo intente una predicción de empaquetamiento de dominios. La precisión intradominio de AlphaFold se evaluó más exhaustivamente en CASP14 y se espera que sea mayor que su precisión entre dominios. Sin embargo, AlphaFold fue el método mejor clasificado en la evaluación entre dominios y esperamos que produzca una predicción informativa en algunos casos. Alentamos a los usuarios a ver el gráfico PAE para determinar si es probable que la ubicación del dominio sea significativa.

Trabajo futuro

Estamos entusiasmados con el futuro de la biología estructural computacional. Quedan muchos temas importantes por abordar: predecir la estructura de complejos, incorporar componentes no proteicos y capturar la dinámica y la respuesta a mutaciones puntuales. El desarrollo de arquitecturas de red como AlphaFold que destacan en la tarea de comprender la estructura de las proteínas es motivo de optimismo en cuanto a que podemos avanzar en los problemas relacionados.

Vemos AlphaFold como una tecnología complementaria a la biología estructural experimental. Quizás esto se ilustra mejor por su papel para ayudar a resolver estructuras experimentales, mediante el reemplazo molecular y el acoplamiento en volúmenes crio-EM. Ambas aplicaciones pueden acelerar la investigación existente, ahorrando meses de esfuerzo. Desde una perspectiva bioinformática, la velocidad de AlphaFold permite la generación de estructuras predichas a escala masiva. Esto tiene el potencial de desbloquear nuevas vías de investigación, al respaldar investigaciones estructurales del contenido de grandes bases de datos de secuencias.

En última instancia, esperamos que AlphaFold demuestre ser una herramienta útil para iluminar el espacio de las proteínas y esperamos ver cómo se aplica en los próximos meses y años.

Nos encantaría escuchar sus comentarios y comprender cómo AlphaFold y AlphaFold DB han sido útiles en su investigación. Comparte tus historias en alfafold@deepmind.com.